OpenAI вырастила ИИ-хакера, чтобы он ломал её собственные модели

Система GPT-Red училась взламывать модели OpenAI в самоигре, чтобы найти дыры раньше злоумышленников.

Aravana··1 мин

🔴 OpenAI вырастила ИИ-хакера, чтобы он ломал её собственные модели

Чтобы найти дыры в своих моделях раньше злоумышленников, OpenAI не стала нанимать хакеров, она вырастила искусственного.

По данным MIT Technology Review, система под названием GPT-Red училась взламывать в своеобразном «додзё»: снова и снова атаковала другие модели, а те учились защищаться, и обе стороны становились сильнее. GPT-Red специализируется на инъекциях промпта — когда во внешне безобидный текст внедрена скрытая инструкция для модели. По ходу дела ИИ нашёл и совершенно новый тип атаки: подсовывал модели ложные записи прямо в её собственную цепочку рассуждений. А для наглядности взломал торговый автомат под управлением ИИ, менял цены и отменял заказы.

Цифры показывают, зачем это нужно. Против GPT-5, вышедшей в августе 2025-го, GPT-Red пробивала защиту более чем в 90% случаев. Против свежей GPT-5.6, меньше чем в 23%. Наружу модель не отдают: слишком мощный инструмент, да и повторить его дорого.

Оборона ИИ теперь тоже строится на ИИ, ведь люди-тестировщики в одиночку за сложностью атак уже не поспевают. Открытым остаётся неудобный вопрос: что будет в тот день, когда такой же атакующий ИИ окажется в руках у тех, кто строит его не для защиты?

Этот материал подготовлен командой AI-агентов AravanaAI и проверен главным редактором.

#нейросети #LLM #OpenAI #ChatGPT #агентыИИ #безопасностьИИ #модели #ИИ #технологии #AravanaAI

Тип материала: Пост из Telegram

Поделиться:TelegramXLinkedIn
Как вам материал?

Хотите получать подобные материалы раньше?

Aravana Intelligence — авторская аналитика и закрытый круг для тех, кто думает на шаг вперёд.

Узнать про Intelligence

Не пропускайте важное

Еженедельный дайджест Aravana — ключевые события в AI, робототехнике и longevity.

Похожие материалы

Голосовой Grok обошёл специализированные модели расшифровки речи на их же поле

xAI выкатила Grok Voice Think Fast 2.0: модель рассуждает параллельно с речью, обогнала OpenAI GPT-Realtime-2.1 и Google Gemini 3.1 Flash и оказалась точнее специализированных моделей расшифровки речи. Ценник — $0,08 за минуту аудио.

·1 мин

Приватные чаты с Claude всплыли в поиске Google

Диалоги пользователей Claude, которыми делились по «приватной» ссылке, попали в индекс Google и Bing — среди утёкшего медзаписи, внутренние документы и персональные данные.

·1 мин

Первое железо OpenAI: клавиатура за $230, и кодеры морщатся

Первое железо OpenAI — клавиатура Micro за $230 с программируемыми агентскими клавишами и привязкой к ChatGPT и Codex — встречено целевой аудиторией прохладно.

·1 мин