스태빌리티 AI, 온디바이스 오디오 모델 공개... 경쟁사들도 진격
스태빌리티 AI는 스마트폰이나 노트북에서 실행되며 2분짜리 트랙을 생성하는 생성형 모델인 오디오 3.0 스몰을 출시했습니다.
온디바이스 오디오 생성
로컬에서 신경망을 실행하면 네트워크 지연 시간이 없고 데이터가 장치 밖으로 나가지 않습니다. 공개 데모는 기본 아키텍처가 6분까지 확장 가능하지만 트랙을 2분으로 제한합니다. 엔지니어는 더 긴 세션을 추진하는 경우 CPU/GPU 사용량과 배터리 소모 간의 균형을 맞춰야 합니다. 예를 들어 2분짜리 트랙에는 상당한 처리 능력이 필요하며 더 긴 트랙은 더 고급 하드웨어가 필요합니다.
온디바이스 오디오 생성의 기술적 역학
온디바이스에서 오디오를 생성하는 기능은 모델의 아키텍처와 장치의 하드웨어 기능에 따라 다릅니다. 스태빌리티 AI는 온디바이스 접근 방식을 선택한 것은 지연 시간을 줄이고 사용자 경험을 개선하는 데 중점을 둔다는 것을 의미합니다. 이 접근 방식은 또한 모델이 장치의 CPU 및 GPU와 상호 작용하는 방식과 배터리 수명에 대한 잠재적 영향에 대한 더 깊은 이해를 필요로 합니다. 모델의 아키텍처는 현대 스마트폰의 제약 내에서 작동하도록 설계되어 온디바이스 오디오 생성을 위한 효율적인 솔루션을 제공합니다.
온디바이스 AI를 향한 광범위한 추진
Figma의 AI 어시스턴트는 Figma Design에 발표되어 동일한 온디바이스 접근성을 추세로 따릅니다. 어시스턴트는 모든 키 입력을 클라우드로 라우팅하지 않고 제안 사항을 제공합니다. 이 접근 방식은 디자이너가 더 효율적으로 작업할 수 있도록 하며 로컬에서 AI 기반 통찰력을 사용할 수 있어 클라우드 연결성에 대한 의존도를 줄여줍니다.
애플의 Vision Pro는 이번 주에 레알 마드리드: 위대한 무게라는 몰입형 동영상을 스트리밍할 예정입니다. 동영상 자체는 AI로 생성되지 않았지만 혼합 현실 헤드셋에서 배포되는 것은 고품질 미디어와 온디바이스 처리가 수렴하는 시장을 강조합니다. Vision Pro의 기능은 온디바이스 처리가 미디어 경험을 개선할 수 있는 잠재력을 보여줍니다.
온디바이스 AI 개발 이력
온디바이스 AI 개발은 새로운 현상이 아닙니다. 이전에 AI를 장치에 통합하려는 시도는 다양한 수준의 성공을 거두었습니다. 예를 들어, 머신러닝 알고리즘을 활용한 초기 스마트폰 애플리케이션은 장치의 처리 능력과 메모리로 인해 종종 제한되었습니다. 그러나 하드웨어 및 소프트웨어의 발전으로 더 정교한 온디바이스 AI 모델 생성이 가능해졌습니다. 특수 AI 칩 및 개선된 신경망 아키텍처의 도입으로 온디바이스 처리가 더욱 효율적으로 이루어졌습니다.
에이전트 중심 모델 등장
Hacker News의 Qwen 3.7-Max 발표는 다른 대화를 촉발했습니다. 이 모델은 도구 사용 및 다단계 계획과 같은 복잡한 작업을 목표로 합니다. 스태빌리티의 오디오 초점과 달리 Qwen의 목표는 소프트웨어 에이전트에 의사 결정 기능을 포함하는 것입니다. 이 접근 방식은 AI 모델의 다양성과 다양한 도메인에서의 잠재적 응용 프로그램을 강조합니다.
경쟁 역학 및 열린 질문
스태빌리티 AI, Figma, 애플, Qwen은 모두 클라우드 전용 API에서 통합 경험으로의 변화를 보여줍니다. 문제는 온디바이스 제약으로 인해 새로운 종류의 경량 모델이 강제될 것인지 아니면 하드웨어 발전으로 전체 규모 추론이 가능할 것인지입니다. 업계가 계속 발전함에 따라 온디바이스 AI의 혁신적인 응용 프로그램을 더 많이 볼 수 있을 것으로 예상됩니다.
향후 개발
스태빌리티 AI는 올해 말에 더 큰 버전의 오디오를 출시할 계획입니다. Figma는 어시스턴트를 Design 이상으로 확장할 예정입니다. 애플의 Vision Pro 라인업에는 더 많은 AI 강화 미디어가 포함될 가능성이 있습니다. 온디바이스 AI와 소비자 기술의 교차점이 계속 발전함에 따라 더 많은 혁신적인 응용 프로그램과 새로운 기회가 등장할 것으로 예상됩니다.