Три секунды аудио — столько нужно современному инструменту клонирования, чтобы получить 85-процентное совпадение с вашим голосом. Дальше — скрипт, звонок вашему CFO «голосом» CEO и срочная просьба оплатить неожиданный счёт. Это не прогноз: опрос McAfee показал, что каждый четвёртый сталкивался с войс-клон скамом или знает пострадавшего, а 77% получивших такое сообщение потеряли деньги. 2026 год сделал голосовой фишинг индустрией — с платформами, тарифами и волной атак на крупнейшие хедж-фонды Уолл-стрит. На этом фоне компании внедряют собственных голосовых агентов для поддержки и продаж. Вопрос, который стоит задать до запуска: если голос больше не доказывает личность, на чём держится доверие к вашему голосовому контуру?
Голос перестал быть доказательством
Десятилетиями голос был имплицитным фактором аутентификации: «я узнал голос — значит, это он». Генеративный ИИ обнулил это допущение. Исследователи McAfee Labs за две недели нашли в открытом доступе больше десятка бесплатных инструментов клонирования, требующих базовой квалификации. NCC Group демонстрирует realtime deepfake vishing с клоном, построенным по пяти минутам записи. Опросы показывают, что 70% людей не уверены, что отличат клон от оригинала, а эксперименты с blind-прослушиванием дают угадывание на уровне монетки. Публичное выступление, подкаст, сторис — исходного материала для клона руководителя достаточно у любого публичного человека.
Отсюда базовый принцип голосовой безопасности 2026 года: технически убедительный, естественно звучащий звонящий — не свидетельство легитимности. Ни тон, ни знание контекста, ни «правильный» номер (spoofing никто не отменял) ничего не доказывают.
Волна 2026: Уолл-стрит, ATHR, FBI
Три эпизода задают масштаб угрозы:
Уолл-стрит под vishing-волной. Летом 2026 года хакеры провели серию атак с AI-клонированием голоса против Point72, Citadel, Millennium и Two Sigma, выдавая себя за топ-менеджеров, чтобы выманить чувствительную информацию у сотрудников. Прорывов данных не зафиксировано — но OECD классифицировал эпизоды как AI-инциденты: ИИ был центральным инструментом атаки на критическую финансовую инфраструктуру.
ATHR: vishing как платформа. В апреле 2026 года Abnormal Security описала ATHR — первую криминальную платформу, полностью автоматизировавшую цепочку телефонного фишинга: AI voice agent на Asterisk/WebRTC ведёт многошаговый скрипт социальной инженерии, синхронизируясь с фишинговыми панелями под восемь сервисов (Google, Microsoft, Coinbase, Binance, Gemini, Crypto.com, Yahoo, AOL). Агент выманивает у жертвы шестизначный код и панель тут же подставляет его в настоящий сервис — внутри узкого окна действия TOTP. Кампания масштаба стоит покупателю от $4 000. Угроза, раньше требовавшая команды skilled-операторов, стала товаром.
FBI и цифры роста. Ещё в мае 2025 года ФБР предупреждало о кампании имперсонации высших чиновников США через тексты и AI-клонированный голос. По данным CrowdStrike, использование AI-клонирования голоса выросло на 442% за второе полугодие 2024 года. WEF в отчёте 2026 года фиксирует итог: мошенничество обгоняет ransomware как топ-риск, 73% CEO лично затронуты кибермошенничеством, 62% сталкивались с фишингом включая голосовой. Кейсы «голос босса просит CFO оплатить счёт» известны минимум с 2018 года — изменился масштаб, цена и качество.
Как работает современный vishing-конвейер
Разберите цепочку ATHR как типовую — защита строится против неё, а не против «звонка мошенника» в абстракте:
- Приманка. Email или сообщение с номером «поддержки» — классический TOAD (telephone-oriented attack delivery).
- Агент вместо оператора. Жертва звонит сама — и попадает на AI-агента, который не устаёт, не сбивается под давлением и ведёт десятки параллельных звонков.
- Извлечение кода. Агент выманивает TOTP или данные карты естественным диалогом, подстраиваясь под ответы.
- Релей в реальном времени. Панель оператора подставляет код в настоящий сервис, пока окно действия открыто, — аутентификация проходится от имени жертвы.
- Закрепление. OAuth device flow abuse в Entra-окружениях и аналогичные техники превращают разовый код в durable-доступ.
Каждый этап — автоматизируемая компонента. Оборона обязана рвать цепочку минимум в двух местах: до извлечения (аутентификация звонящего) и после (коды и действия не по звонку).
Ваш агент как поверхность: шесть рисков
Собственный голосовой агент добавляет риски поверх общих агентных:
- Имперсонация вашего агента. Злоумышленник клонирует голос вашего бота и обзванивает клиентов «от имени компании». Клиент не отличит — у него нет образца «настоящего» для сравнения в момент звонка.
- Промпт-инъекция через аудио. Вредоносные инструкции не обязательно в тексте: их можно произнести. Агент, обрабатывающий речь как команды, уязвим к spoken-инъекциям, включая фоновый звук и подставных «коллег» рядом с трубкой.
- Утечки через разговор. Агент называет PAN, балансы, диагнозы вслух — в окружении, которое вы не контролируете (громкая связь, офис, семья рядом). Озвучивание чувствительного — отдельный класс утечки.
- Социальная инженерия против агента. Звонящий выманивает у вашего агента данные или действия: «подтвердите перевод», «продиктуйте код из SMS». Вежливый агент поддержки — идеальная жертва.
- Записи разговоров как хранилище. Транскрипты с номерами карт, паспортными данными и медицинскими фактами оседают в логах — со всеми требованиями к хранению чувствительного.
- Авторитет голоса. Люди подчиняются «голосу компании» охотнее, чем письму: психологический вес звонка работает и на легитимного агента (клиент соглашается быстрее, чем стоит), и на его клон.
Контроли: аутентификация, запреты, маркировка
Аутентифицируйте звонящего, а не голос. Голос — username, не пароль. Для чувствительных действий — второй фактор вне звонка: пуш в приложение, код в мессенджер, кодовое слово, заранее согласованное с клиентом. Процедуры восстановления и выдачи тоже требуют out-of-band проверки, иначе они становятся обходным путём.
Запретите необратимое по звонку. Коды из SMS, полные PAN, переводы, смена получателей — не произносятся и не принимаются по телефону как достаточное основание. Агент готовит, второй контур подтверждает. TOTP, продиктованный в трубку, должен считаться скомпрометированным по построению.
Маркируйте своих агентов. Клиент обязан иметь способ проверить, что звонит именно ваш агент: исходящие только с презентованных номеров из allowlist-публикации, SMS-подтверждение звонка в приложении, кодовая фраза сессии, которую клон не знает. В идеале — инверсия: агент не звонит сам, а просит клиента перезвонить на официальный номер или подтвердить в приложении.
Обучите людей и агентов. Security awareness обновляется под AI-голоса: «убедительно и естественно» больше не аргумент. Для сотрудников — процедура проверки любого голосового поручения с деньгами (перезвон по известному номеру, кодовое слово). Для агентов — скрипты отказа: какие просьбы звонящего отклоняются всегда и что говорится вместо.
Детект клонов. Deepfake-детекторы голоса — вспомогательный слой: сигналят о синтетике, но не дают гарантий и деградируют с качеством синтеза. Используйте как триггер усиленной проверки, а не как вердикт.
Запись и согласие
Голосовой контур пишет всё — и это регулируется. Согласие на запись (двухстороннее во многих юрисдикциях), сроки хранения транскриптов, удаление по запросу, ограничение доступа к записям, redaction чувствительного в транскриптах до хранения. Запись, нужная для разбора споров, — актив с ограниченным доступом, а не общая папка. Отдельно: голоса клиентов — биометрия в ряде режимов регулирования; храните признаки, а не сырьё, и только с правовым основанием.
Чеклист запуска голосового агента
- Чувствительные действия требуют второго фактора вне звонка; коды по телефону не принимаются.
- Агент никогда не озвучивает полные PAN, коды, пароли; транскрипты проходят redaction до хранения.
- Свои исходящие маркированы: allowlist номеров, подтверждение в приложении, кодовая фраза сессии.
- Скрипты отказа агента на выманивание данных и действий протестированы spoken-инъекциями.
- Согласие на запись, сроки хранения и доступ к записям оформлены и enforced.
- Сотрудники обучены: голосовое поручение с деньгами проверяется перезвоном по известному номеру.
- Детект синтетики включён как триггер усиленной проверки, а не как единственный контроль.
- Журнал решений агента пишется по звонку: кто звонил, что запрошено, что выдано, что отклонено.
Где Codenik
Голосовой агент в архитектуре Codenik — тот же агент с теми же границами, плюс голосовая специфика. Скоупы запрещают необратимое по звонку на уровне инструментов: кода подтверждения просто нет в доступных действиях голосовой роли. Маскирование режет PAN из контекста до модели — агенту нечего озвучить. Каждый ход диалога с решением пишется в журнал: что звонящий просил, что агент выдал, что отклонил и по какому правилу. А маркировка исходящих и второй фактор в приложении закрывают контур доверия, который голос сам по себе больше не даёт. Дипфейк может скопировать голос — скопировать скоупы, журнал и approval-контур он не может.
Короткий вывод
Голос как идентификатор мёртв: три секунды аудио, $4 000 за кампанию, волна атак на крупнейшие фонды. Стройте голосовой контур так, будто каждый звонок — потенциальный клон: аутентификация вне звонка, запреты на необратимое, маркировка своих, redaction записей. Тогда собственный голосовой агент станет преимуществом, а не самым убедительным вектором против вас.