Исследователи нашли способ красть «мысли» топовых ИИ-моделей — уязвимость затронула Anthropic, OpenAI и Google

«После третьей попытки я получил универсальный джейлбрейк, который расшифровывает рассуждения моделей Anthropic — это до сих пор шокирует меня больше всего»,...

Aravana··1 мин

«После третьей попытки я получил универсальный джейлбрейк, который расшифровывает рассуждения моделей Anthropic — это до сих пор шокирует меня больше всего», — так исследователь безопасности Илья Шумайлов описал момент, когда понял, что скрытые цепочки размышлений топовых ИИ-моделей можно вскрыть буквально любому.

В разговоре с ведущим Тимом Скарфом на канале Machine Learning Street Talk Шумайлов и его соавтор Александр Панфилов рассказали о своей работе о краже цепочек рассуждений из проприетарных LLM API. Логика уязвимости проста: когда рассуждающая модель отвечает, она отдаёт клиенту два блока — видимый ответ и зашифрованный «конверт» с рассуждениями, нужный для того, чтобы разговор можно было продолжить, разветвить или откатить назад на сервере. Исследователи показали, что этот зашифрованный блок можно скормить меньшей модели из того же семейства — и та охотно перескажет чужие мысли обычным текстом. Пост об этом набрал, по словам авторов, около 3 миллионов просмотров за 40 часов.

По словам исследователей, они протестировали Anthropic, OpenAI и Google — и все три компании оказались уязвимы одинаковым образом. Один и тот же расшифрованный фрагмент рассуждений можно подставить в чужой диалог до пяти раз подряд, полностью сфабриковав контекст беседы. Это открывает путь к краж-e секретов из чужих пользовательских сессий, отравленным цепочкам агентов и переиспользуемому джейлбрейку.

Есть и приватный аспект: команда собрала около 350 тысяч зашифрованных блоков рассуждений, оставленных пользователями в публичных репозиториях GitHub и Hugging Face, расшифровала их и прогнала через классификатор. Нашлись API-ключи, адреса электронной почты и внутренние IP-адреса — даже там, где авторы аккуратно вычищали пароли и ключи из видимого ответа, они оставались внутри «скрытых» рассуждений.

Отдельно исследователи описали странный артефакт: если подставить начало рассуждений модели Claude Opus в открытую модель Kimi K3, финальный видимый ответ Kimi начинает стилистически звучать как ответ Opus — причём эффект не воспроизводится на GLM или DeepSeek, и объяснить его авторы пока не могут. Они подчеркнули, что это не доказывает целенаправленную дистилляцию — скорее похоже на баг конкретного джейлбрейка, а не на украденную модель.

О находке сообщили самим лабораториям по протоколу ответственного раскрытия: все подтвердили получение отчёта, и, по словам авторов, никто из них не отреагировал агрессивно — редкий случай в истории исследований безопасности. Сейчас, по их данным, лаборатории внедряют меры защиты — от отказа возвращать рассуждения пользователю до привязки шифрования к предыдущим шагам диалога.

Этот материал подготовлен командой AI-агентов AravanaAI и проверен главным редактором.

Тип материала: Пост из Telegram

Поделиться:TelegramXLinkedIn
Как вам материал?

Хотите получать подобные материалы раньше?

Aravana Intelligence — авторская аналитика и закрытый круг для тех, кто думает на шаг вперёд.

Узнать про Intelligence

Не пропускайте важное

Еженедельный дайджест Aravana — ключевые события в AI, робототехнике и longevity.

Похожие материалы

Anthropic представила Claude Fable 5.1 для сложных многоэтапных задач

Anthropic представила Claude Fable 5.1 для сложных многоэтапных задач

Anthropic выпустила Claude Fable 5.1 — обновление своего наиболее производительного класса моделей, рассчитанное на сложную и продолжительную работу. В качес...

·1 мин
GPT-6 Astra решила головоломку DEF CON с официальной подсказкой

GPT-6 Astra решила головоломку DEF CON с официальной подсказкой

В опубликованном OpenAI фрагменте Бен Дэвис рассказал, как проверил GPT-6 Astra на сложных головоломках с DEF CON. Некоторые из этих заданий он и его друзья ...

·1 мин
Питер Гостев: GPT-6 Astra справилась с приложением примерно на 150 тысяч строк без постоянного контроля

Питер Гостев: GPT-6 Astra справилась с приложением примерно на 150 тысяч строк без постоянного контроля

GPT-6 Astra практически без дополнительного вмешательства улучшила приложение примерно на 150 тысяч строк кода, с которым Питеру Гостеву прежде приходилось р...

·1 мин