PhoneLLM открытая модель для голосовых агентов.
29 августа 2026, 06:09
|
Представляем PhoneLLM — открытую модель для голосовых агентов. Производительность GPT 5.6 Terra при выполнении типичных задач голосовых агентов в 3 раза ниже по задержкам и в 18 раз дешевле. Для голосовых агентов нужны модели с очень низкой задержкой и способностью вызывать инструменты и выполнять инструкции. Здесь приходится искать компромисс, и при создании голосовых агентов нам часто приходится жертвовать либо скоростью работы, либо функциональностью. С помощью PhoneLLM (а также стека инструментов для обучения и обработки данных, благодаря которому появилась эта модель) мы решаем эту проблему. В последние пару лет большая часть усилий по разработке передовых моделей была направлена на использование вычислительных ресурсов во время тестирования. И это здорово! Доступны модели самых разных форм и размеров, которые работают очень, очень хорошо... если у вашей модели включена функция «мышления». Но если вам нужно, чтобы ваш агент реагировал со скоростью голосового общения, вам не подойдут модели с функцией «мышления». PhoneLLM — это модель NVIDIA Nemotron Nano 30B с полной тонкой настройкой весов. Мы обучали ее на широком спектре реальных сценариев использования в сфере телефонии и клиентской поддержки. В ходе обучения основное внимание уделялось использованию превосходных базовых возможностей Nano 30B и обучению модели выполнению типичных задач голосового агента с отключенным мышлением. |
Результаты действительно хорошие: точный вызов инструмента и краткие ответы по теме в длительных разговорах. И быстро: время ожидания, измеренное на стороне сервера, составляет <100 мс, если вы запускаете PhoneLLM на слегка загруженном B200. :-) Но если серьезно, то когда мы оцениваем задержку модели, мы делаем это с помощью полного, сквозного, пакетного моделирования запросов с использованием реальных конвейеров голосового агента Pipecat. Вы можете одновременно обслуживать более 80 агентов на одном B200 при сквозной скорости передачи данных P95 менее 600 мс. Включая нагрузку на сеть. Это составляет около 0,0025 доллара в минуту (1/4 процента). При более низкой задержке, чем сегодня предлагает любой сторонний API.
