Получить КП

OpenAI выпустила GPT-Realtime-2.1: голосовые AI-агенты с рассуждением и снижением задержки на 25%

OpenAI выпустила GPT-Realtime-2.1: голосовые AI-агенты с рассуждением и снижением задержки на 25%

Согласно официальному анонсу OpenAI, компания выпустила две новые модели Realtime API — gpt-realtime-2.1 и gpt-realtime-2.1-mini — доступные с 6 июля 2026 года. Модели предназначены для создания голосовых и мультимодальных AI-агентов с низкой задержкой и встроенными возможностями рассуждения.

Снижение задержки: что изменилось

По данным OpenAI, улучшенное кэширование промптов позволяет снизить p95-латенцию (задержку для 5% самых медленных ответов) как минимум на 25% для всех голосовых моделей Realtime API. Улучшение затрагивает каждую существующую интеграцию — миграция модели не требуется.

Кэширование контекста работает на уровне инфраструктуры: системный промпт и история диалога сохраняются между ответами, вместо того чтобы перерабатываться с нуля на каждом шаге. В производственных голосовых агентах это критически важно — пользователь на линии считывает паузу как обрыв, в отличие от текстового интерфейса, где полсекунды задержки незаметны.

GPT-Realtime-2.1: полная модель с конфигурируемым рассуждением

Модель gpt-realtime-2.1 поддерживает speech-to-speech взаимодействие с настраиваемым уровнем рассуждения (пять уровней: minimal, low, medium, high, xhigh), улучшенное распознавание буквенно-цифровых символов и корректную обработку фонового шума и прерываний. Как сообщила OpenAI в своём developer community, модель справляется с ситуациями, когда собеседник на линии исправляет себя: «не заказ 742, а заказ 744» — без накопления ошибки.

Цены: $4 за миллион входных текстовых токенов, $24 за миллион выходных текстовых токенов; $32 за миллион входных аудиотокенов, $64 за миллион выходных аудиотокенов.

GPT-Realtime-2.1-mini: рассуждение без тишины

Ключевое нововведение релиза — gpt-realtime-2.1-mini, дистиллированная модель рассуждения, которая может говорить в процессе выполнения tool call. В стандартной архитектуре голосовой агент замолкает на время обращения к функции — проверки баланса, статуса заказа, запроса в базу данных. Эта пауза воспринимается пользователем как обрыв связи.

Mini-версия решает проблему: модель одновременно генерирует речевой преамбул («Я сейчас проверю ваш заказ») и выполняет вызов функции, затем переходит к результату без зазора. OpenAI называет это «рассуждением во время речи» (reasoning-while-talking) — механизм работает за счёт разделения внутреннего шага рассуждения и генерации аудиовыхода.

Цены mini-версии: $10 за миллион входных аудиотокенов, $20 за миллион выходных аудиотокенов — примерно в 3,2 раза дешевле полной модели на аудиовыходе и в 10 раз дешевле на текстовом выводе.

Позиционирование на рынке голосовых AI-агентов

Как отмечает Tech Times, выпуск 2.1 — это не новая базовая модель, а сервисный апдейт с улучшениями инфраструктурного слоя и дистиллированной mini-версией. Каденция обновлений (примерно раз в два месяца) сигнализирует, что OpenAI рассматривает Realtime API как продукт в активной разработке, а не замороженный preview.

Конкурентное поле: Google Gemini 3.1 Flash Live (март 2026) работает на сопоставимой задержке и покрывает более 90 языков против примерно 50 у OpenAI. Независимые слепые тесты начала 2026 года поставили OpenAI Realtime на третье место по естественности голоса — после ElevenLabs и Gemini. Однако по зрелости SDK, надёжности tool call и качеству обработки прерываний позиции OpenAI сильнее.

Что это значит для бизнеса

Для компаний, внедряющих голосовых AI-агентов в колл-центры, поддержку клиентов и телемедицину, gpt-realtime-2.1-mini устраняет архитектурную проблему, которая делала голосовых агентов непригодными для production: паузы при вызове функций. Возможность поддерживать непрерывный диалог без «зависаний» критически важна для качества обслуживания.

При этом необходимо учитывать регуляторные ограничения: FCC с февраля 2024 года приравнивает AI-голоса к «искусственному или записанному голосу» по TCPA, что требует явного согласия на исходящие звонки. Аудиомодальность Realtime API не покрывается BAA OpenAI для HIPAA, что ограничивает применение в медицинских сценариях без гибридной архитектуры.

Lisa AI — оптовый поставщик корпоративного API-доступа к нейросетям в РФ — предоставляет прямой доступ к 100+ LLM для юридических лиц, включая модели OpenAI. Оплата по счёту с НДС, закрывающие документы, запуск за 1–3 дня. Оставьте заявку на lisa-ai.ru.