BTC ETH SOL XRP DOGE S&P 500 NASDAQ DOW EUR/USD USD/JPY GOLD
BTC ETH SOL XRP DOGE S&P 500 NASDAQ DOW EUR/USD USD/JPY GOLD

Read the English original

Stability AI 发布设备端音频模型,竞争对手也在推进

AI

Stability AI 发布了 Audio 3.0 small,一款可在手机或笔记本电脑上运行并生成两分钟音频 tracks 的生成式模型。

该模型是 Audio 系列中最新一款”small” 版本。 Stability AI 声称,该小型模型适合现代智能手机的内存范围。用户可以通过桌面客户端或移动应用调用该模型,并在几秒钟内收到完成的音频 clips。

设备端音频生成

在本地运行神经网络意味着没有网络延迟,也没有数据离开设备。公共演示将音频 tracks 限制在两分钟,即使底层架构可以扩展到六分钟。工程师需要平衡 CPU/GPU 使用率和电池寿命,如果他们延长会话时间。例如,一个两分钟的音频 tracks 需要大量处理能力,更长的 tracks 需要更高级的硬件。

设备端音频生成的技术机制

设备端生成音频的能力取决于模型的架构和设备的硬件能力。Stability AI 选择设备端方法意味着专注于降低延迟和增强用户体验。这种方法还需要更深入地了解模型如何与设备的 CPU 和 GPU 交互,以及对电池寿命的潜在影响。模型的架构旨在在现代智能手机的限制内工作,使其成为设备端音频生成的有效解决方案。

设备端 AI 的广泛推动

Figma 为 Figma Design 推出的 AI 助手遵循了相同的设备端可访问性趋势。该助手在无需将每个按键发送到云端的情况下提供建议。这种方法使设计师能够更高效地工作,本地提供 AI 驱动的洞察,减少对云连接的依赖。

苹果的 Vision Pro 将于本周晚些时候播放一款名为 Real Madrid: The Weight of Greatness 的沉浸式视频。该视频本身并非由 AI 生成,但其在混合现实头戴设备上的分发强调了高保真媒体和设备端处理融合的市场。Vision Pro 的能力展示了设备端处理增强媒体体验的潜力。

设备端 AI 开发的历史

设备端 AI 的开发并不是一个新现象。早期在设备中集成 AI 的尝试取得了不同程度的成功。例如,早期利用机器学习算法的智能手机应用程序通常受到设备处理能力和内存的限制。然而,硬件和软件的进步使得创建更复杂的设备端 AI 模型成为可能。专用 AI 芯片和改进的神经网络架构的引入为更高效的设备端处理铺平了道路。

智能体中心模型进入竞争

Hacker News 上发布的 Qwen 3.7-Max 消息引发了不同的讨论。该模型针对复杂任务,如工具使用和多步骤规划。与 Stability 的音频关注点不同,Qwen 的目标是将决策能力嵌入到软件智能体中。这种方法突出了 AI 模型的灵活性及其在各个领域的潜在应用。

竞争动态和开放问题

Stability AI、Figma、苹果和 Qwen 都说明了一个转变:AI 从云端 API 转移到集成体验。问题在于,设备端限制是否会迫使出现一类新的轻量级模型,或者硬件进步是否会使全面推理可移植。随着行业的不断发展,我们可以期待看到更多创新的设备端 AI 应用。

下游影响

设备端 AI 模型的发布对各利益相关者具有重要影响。例如,开发者需要适应新工具和技术,而用户将受益于增强的体验。此外,设备端 AI 的关注度提高可能会带来新的商业机会和收入来源。公司需要考虑如何利用设备端 AI 为客户创造价值,并在市场中保持竞争力。

关注点

Stability AI 计划今年晚些时候发布更大版本的 Audio。Figma 将把助手扩展到 Design 以外。苹果的 Vision Pro 产品线可能会包含更多 AI 增强的媒体。随着设备端 AI 和消费技术交汇的不断发展,我们可以期待看到更多创新的应用和新机会的出现。

Stability AI 的 Audio 3.0 small 等设备端 AI 模型的发布是朝着更高效、更易用的 AI 解决方案迈出的重要一步。随着硬件能力的提高和软件变得更加复杂,我们可以期待看到更多开创性的设备端 AI 应用。