Нейросеть впервые убедила людей, что по ту сторону видеозвонка сидит живой человек. Стартап Tavus из Сан-Франциско представил модель Griffin, и в слепом тесте 48% собеседников — 26 из 54 — после минутного разговора были уверены, что общались с настоящим человеком.

У прежних систем, включая собственную прошлую разработку Tavus, этот показатель не дотягивал и до 3%: человеком сочли лишь одного участника из 41, то есть 2,4%. Разрыв не косметический, а на порядок — и именно поэтому в компании называют Griffin первой моделью, прошедшей видео-версию теста Тьюринга, той самой, где задача машины — чтобы её приняли за человека.

Любопытная деталь: тех, кто всё-таки заподозрил подвох, выдавало чутьё в первые 20 секунд разговора — дальше сомнения уже не возникали. И уверенность была обоюдной: те, кто решил, что перед ними человек, оценивали свою убеждённость в среднем на 79% и называли собеседницу приятной и располагающей. Больше половины призналось, что мысль о подделке за минуту даже не мелькнула.

Минута, которой хватило

Что умеет Griffin? Она одновременно смотрит, слушает и отвечает, не дожидаясь своей очереди. Может кивнуть и поддакнуть, пока вы говорите, перебить и дать перебить себя, уловить паузу — и не принять её за конец реплики. В демо она подсказывает, как собрать кубик Рубика, глядя на него через камеру: следит за гранями, пока вы крутите, и терпеливо ждёт, если вы задумались.

В других роликах модель играет в «Саймон говорит», на ходу сочиняет историю вместе с собеседником и проводит человека через пайку платы, сверяясь со временем и подсказывая следующий шаг.

Секрет в архитектуре. Большинство голосовых ассистентов работают как эстафета: один модуль распознаёт речь, второй придумывает ответ, третий озвучивает — и на каждой передаче теряются интонация и мимика. Griffin устроена иначе: это единая система video-to-video, которая каждые доли секунды заново решает, молчать ей или вступить. Она рисует всю картинку целиком — не только лицо, но и жесты, тени, фон и даже движение стула под человеком.

Голос клонируется с десяти секунд записи, изображение в 720p рождается кусками по 320 миллисекунд, а реагирует модель почти вдвое быстрее ближайших аналогов — и на 37% точнее их попадает в нужный момент. На независимом бенчмарке NVIDIA Griffin заняла первое место сразу по двум трекам и набрала 3,83 балла против 3,92 у живого человека — отставание всего в девять сотых.

Слишком живая, чтобы отдать всем

Основатель и CEO Хассаан Раза называет это «человеческими вычислениями»: будущее, где не человек подстраивается под машину, а машина общается так, как нам привычно с рождения. Звучит красиво — но пока в руках у публики лишь облегчённая версия Griffin-Lite, да и та у избранных тестировщиков.

В Tavus прямо признают: модель реально способна обмануть, поэтому полный релиз отложен до появления защитных механизмов. Инструмент, которого уже ждут полтораста тысяч разработчиков, намеренно держат на замке.

Не инновация, а нарушение

Защита от обмана — это не добрая воля Tavus, а требование закона. Европейский AI Act обязывает прямо предупреждать человека, что он разговаривает с ИИ: со 2 августа 2026 года статья 50 требует такого раскрытия от каждого, кто выпускает подобного «собеседника» на рынок ЕС — и правило бьёт даже по компаниям за пределами Европы, если их продуктом пользуются внутри союза.

Griffin без маркировки — это уже не инновация, а нарушение, и цена ему посчитана: по второму уровню санкций штраф доходит до 15 млн евро или 3% мирового оборота, смотря что больше. А до 2 декабря 2026-го к этому добавляется требование вшивать в сгенерированный контент машиночитаемую метку о его искусственном происхождении.

Лицо и голос в кадре кому-то принадлежат. Griffin клонирует голос всего с десяти секунд записи, а без согласия человека это прямая дорога к искам: о защите изображения, о биометрических данных по GDPR и о личных неимущественных правах. Рекомендации Еврокомиссии, вышедшие в мае 2026-го, уточнили важное — требования к дипфейкам действуют, даже если никто не собирался никого вводить в заблуждение. А отвечает за всё не абстрактная «технология», а тот, кто запустил клон и поставил его перед камерой.

И всё же настоящая опасность не в кубике Рубика, а в том, что модель убедительно притворяется живым человеком. Тот же инструмент — готовый сценарий для романтических афер и выманивания денег. Насколько это серьёзно, показывает громкий случай в Гонконге: сотрудника финансового отдела заманили на видеозвонок, где и финансовый директор, и все «коллеги» оказались дипфейками, собранными из публичных записей, — и он пятнадцатью переводами отправил мошенникам около 25 млн долларов. Griffin поднимает убедительность на новый уровень, а вместе с ней — и ставки. Технология нейтральна. Умысел — нет.

От Anna Mihailova

Окт 5, 2026