Открытый голосовой ИИ: что уже происходило на практике и как не сделать его дорогой игрушкой для атакующих
Голосовой ИИ-консультант на сайте удобен: посетитель говорит с компанией прямо в браузере, а не ищет телефон. Но открытая кнопка — это и открытый платный ресурс. У компании оплачиваются распознавание речи, синтез, работа модели и иногда время живого сотрудника. У человека, который нажал кнопку ради эксперимента или вреда, таких расходов нет.
Мы сами внедряем голосового агента на нашем сайте. Поэтому считаем правильным не скрывать ограничения этой технологии и заранее объяснить, какие злоупотребления уже встречались на практике и какие меры защиты мы закладываем до публичного запуска. Для нас голосовой ИИ — не эксперимент без правил, а публичный сервис, который должен быть ограничен по полномочиям, расходам и работе с данными.
Ниже — не страшилки и не реклама защитных продуктов, а несколько показательных случаев и выводы, которые из них следуют.
1. Бот, который начал ругаться на собственную компанию
В январе 2024 года пользователь добился от чат-бота службы доставки DPD ругани и стихотворения, в котором тот критиковал компанию. Запись разговора быстро разошлась: один пост набрал около 800 тысяч просмотров за сутки. DPD сообщила, что отключила проблемную AI-функцию после обновления системы. The Guardian, 20 января 2024.
Это был текстовый, а не голосовой бот. Но для клиента разницы почти нет: если голосовой агент сказал нечто от имени компании, запись легко вырезать, подписать и опубликовать. Защита здесь — не «волшебный запрет в промпте», а ограниченный набор тем, проверка ответов на провокации и быстрый способ отключить проблемную версию.
2. Компания ответила за слова бота
14 февраля 2024 года трибунал Британской Колумбии рассмотрел спор пассажира с Air Canada. Бот на сайте дал неверную информацию об условиях компенсации, пассажир на неё положился, а позже авиакомпания отказала. Трибунал решил, что компания отвечает за сведения на своём сайте независимо от того, показала их страница или чат-бот, и присудил C$812,02. Moffatt v. Air Canada, 2024 BCCRT 149.
Урок не в размере выплаты. Для публичного агента опаснее привычная фраза «да, это возможно» — о цене, сроке, скидке, условиях услуги. Там, где ответ может быть обещанием, лучше давать утверждённый факт из базы либо передавать разговор человеку.
3. Официальный бот советовал бизнесу нарушать закон
В марте 2024 года расследование The Markup показало, что чат-бот New York City MyCity давал владельцам бизнеса неверные советы по аренде, чаевым, наличным платежам и трудовым правилам. В отдельных ответах он фактически предлагал действия, которые были незаконны. The Markup, 29 марта 2024.
Это не «атака хакера», а опасное сочетание авторитетного тона и неверного ответа. Для голосового ассистента особенно важно не изображать уверенность там, где он не может проверить факт. Полезный принцип: агент объясняет общую информацию, а цены, договоры, юридические и персональные вопросы переводит в проверяемый процесс.
4. Миллионы логов и аудиозаписей оказались доступны из-за ошибки хранения
В феврале 2026 года исследователь безопасности Джеремайя Фаулер обнаружил в открытом доступе три базы данных, связанные с голосовым AI-агентом Sears Home Services. По его данным, там были 3,7 млн логов чатов, 1,4 млн аудиофайлов и текстовые расшифровки звонков за 2024–2026 годы — с именами, телефонами, адресами и деталями заказов. Часть записей длилась часами: звонок оставался открытым после того, как клиент считал разговор законченным, и в запись попадало всё, что происходило вокруг. Базы закрыли после уведомления исследователя; получал ли к ним доступ кто-то ещё, неизвестно. WIRED, март 2026.
Это самый наглядный аргумент не хранить «на всякий случай» весь звук. У записей должен быть понятный срок, доступ по ролям, шифрование и регулярная проверка, не открыто ли хранилище случайно.
5. Телефонную инфраструктуру уже используют как оружие
Телефонный отказ в обслуживании — TDoS — устроен просто: огромное число вызовов занимает каналы и очередь, пока настоящие люди не могут дозвониться. Американское агентство кибербезопасности CISA опубликовало разбор реального случая: центр экстренной связи годами отбивался от ежедневных TDoS-атак. CISA, 2022. В другом документированном деле FCC установила, что участники схемы ScammerBlaster сделали почти 10 млн автоматических звонков на бесплатные для звонящего номера, зарабатывали на оплате, которую за такие звонки платит получатель, и тратили эти деньги на TDoS-атаки. В сентябре 2023 года регулятор назначил штраф $116 млн. FCC, 2023.
В браузерном голосовом виджете транспорт другой, но цель та же. Вместо тысяч телефонных звонков можно попытаться открыть тысячи браузерных сессий, расходовать токены модели или держать микрофон в тишине. Поэтому лимит нужен до старта дорогого разговора, а не только после него.
6. Синтетический голос уже стал инструментом телефонного обмана
В январе 2024 года жителям Нью-Гэмпшира звонили роботы с подменённым номером и AI-клоном голоса президента Байдена, призывая не идти на выборы. В августе 2024 года оператор Lingo Telecom, через сеть которого шли звонки, заключил с FCC мировое соглашение на $1 млн. В сентябре 2024 года FCC окончательно назначила организатору звонков отдельный штраф $6 млн. FCC, 21 августа 2024.
Этот кейс не о веб-боте и не означает, что любой искусственный голос преступен. Он показывает другое: при подключении обычных телефонных линий нельзя считать номер на экране или знакомый голос достаточным доказательством личности. Исходящие звонки, обратные звонки и перевод на внешние номера требуют отдельной защиты от мошенничества.
7. «Дорогая кнопка» — признанный класс риска, хотя публичных сумм мало
Профессиональное сообщество по безопасности приложений OWASP в списке главных рисков для приложений на языковых моделях (2025) выделило «неограниченное потребление»: злоумышленник запускает слишком много или слишком тяжёлых обращений к модели и превращает оплату за использование в экономический отказ в обслуживании. OWASP рекомендует проверку входящих данных, ограничение частоты запросов, квоты, тайм-ауты и контроль ресурсов. OWASP, 2025.
Пока нет широко опубликованного достоверного случая с названной суммой ущерба именно от бесплатного браузерного голосового ИИ-виджета. Это важная честная оговорка. Но отсутствие публичной суммы не делает механизм безопасным: у голосового интерфейса одновременно оплачиваются несколько слоёв — аудио, модель и иногда оператор.
Что должен сделать любой, кто открывает голосового ИИ-агента
- Давать браузеру короткоживущую сессию, а не постоянный ключ к сервисам.
- Ограничить число стартов, параллельных разговоров, минут, реплик и токенов; иметь дневной и часовой денежный стоп-кран.
- Закрывать разговор после разумной тишины, а не оплачивать забытый микрофон.
- Передавать к человеку только во внутреннюю очередь и не позволять агенту звонить или писать на произвольный номер.
- Давать ответы о ценах и условиях только из утверждённого источника; при сомнении — не обещать, а передавать человеку.
- Проверять обновления на провокации: просьбы раскрыть инструкции, грубость, ошибки цены, повторные переводы, искусственный звук и длинные паузы.
- Минимизировать записи, защищать их и заранее назначить человека, который может быстро отключить виджет.
Честный вывод
Открытый голосовой ИИ не становится безопасным от того, что он «вежливый» или умеет отличать тему разговора. Его надо проектировать как публичный платный сервис и как сотрудника, чьи слова могут быть записаны. Нельзя полностью отличить человека от хорошего автомата и нельзя гарантированно отсечь манипуляции с инструкциями модели одним фильтром. Зато можно заранее ограничить максимальный расход, не давать модели опасных полномочий, не пускать злоумышленника в очередь бесконечно и не оставлять записи без защиты.
Это не убивает удобство сервиса. Это просто делает его пригодным для открытого доступа.
Над чем мы работаем сейчас
Мы сами строим голосовых ИИ-агентов и хорошо знаем, как звучит синтезированная речь. Поэтому следующим шагом делаем детектор поддельного голоса: модуль, который по ходу разговора отличает живого человека от записи и от синтеза. Он будет работать внутри нашего голосового движка. Подробности опубликуем, когда будет что показать.