Stability AI、オンデバイスオーディオモデルを発表 ライバル各社が進出
Stability AIは、電話やノートパソコンで動作し、2分間のトラックを生成する、生成モデル「Audio 3.0 small」をリリースした。
オンデバイスオーディオ生成
オンデバイスでニューラルネットワークを動作させることで、ネットワークレイテンシがなくなり、デバイスからデータが出力されない。パブリックデモでは、トラックは2分間に制限されているが、基本アーキテクチャは最大6分まで拡張可能。エンジニアは、セッションを長くする場合、CPU/GPU使用率とバッテリー消費のバランスを取る必要がある。
オンデバイスオーディオ生成の技術的メカニズム
オンデバイスでオーディオを生成する能力は、モデルのアーキテクチャとデバイスのハードウェア機能によって決まる。Stability AIがオンデバイスアプローチを選択したことは、レイテンシを減らし、ユーザーエクスペリエンスを向上させることに重点を置いていることを示している。このアプローチでは、モデルがデバイスのCPUとGPUとどのように相互作用するか、およびバッテリー寿命への潜在的な影響をより深く理解する必要がある。
オンデバイスAIの動向
FigmaのAIアシスタントは、Figma Design向けに発表されたが、オンデバイスでのアクセシビリティという同じトレンドに従っている。アシスタントは、すべてのキー入力をクラウドに送信せずに提案を提供する。このアプローチにより、デザイナーはより効率的に作業でき、AIによる洞察がローカルで利用可能になり、クラウド接続への依存が軽減される。
関連技術の進展
Qwen 3.7-Maxは、Hacker Newsで発表され、別の議論を引き起こした。このモデルは、ツール使用やマルチステップ計画などの複雑なタスクを対象としている。Stabilityのオーディオフォーカスとは異なり、Qwenの目標は、ソフトウェアエージェントに意思決定機能を組み込むことである。