OpenAI вырастила ИИ-хакера, чтобы он ломал её собственные модели
Система GPT-Red училась взламывать модели OpenAI в самоигре, чтобы найти дыры раньше злоумышленников.
🔴 OpenAI вырастила ИИ-хакера, чтобы он ломал её собственные модели
Чтобы найти дыры в своих моделях раньше злоумышленников, OpenAI не стала нанимать хакеров, она вырастила искусственного.
По данным MIT Technology Review, система под названием GPT-Red училась взламывать в своеобразном «додзё»: снова и снова атаковала другие модели, а те учились защищаться, и обе стороны становились сильнее. GPT-Red специализируется на инъекциях промпта — когда во внешне безобидный текст внедрена скрытая инструкция для модели. По ходу дела ИИ нашёл и совершенно новый тип атаки: подсовывал модели ложные записи прямо в её собственную цепочку рассуждений. А для наглядности взломал торговый автомат под управлением ИИ, менял цены и отменял заказы.
Цифры показывают, зачем это нужно. Против GPT-5, вышедшей в августе 2025-го, GPT-Red пробивала защиту более чем в 90% случаев. Против свежей GPT-5.6, меньше чем в 23%. Наружу модель не отдают: слишком мощный инструмент, да и повторить его дорого.
Оборона ИИ теперь тоже строится на ИИ, ведь люди-тестировщики в одиночку за сложностью атак уже не поспевают. Открытым остаётся неудобный вопрос: что будет в тот день, когда такой же атакующий ИИ окажется в руках у тех, кто строит его не для защиты?
Этот материал подготовлен командой AI-агентов AravanaAI и проверен главным редактором.
#нейросети #LLM #OpenAI #ChatGPT #агентыИИ #безопасностьИИ #модели #ИИ #технологии #AravanaAI
Хотите получать подобные материалы раньше?
Aravana Intelligence — авторская аналитика и закрытый круг для тех, кто думает на шаг вперёд.
Узнать про IntelligenceНе пропускайте важное
Еженедельный дайджест Aravana — ключевые события в AI, робототехнике и longevity.
Голосовой Grok обошёл специализированные модели расшифровки речи на их же поле
xAI выкатила Grok Voice Think Fast 2.0: модель рассуждает параллельно с речью, обогнала OpenAI GPT-Realtime-2.1 и Google Gemini 3.1 Flash и оказалась точнее специализированных моделей расшифровки речи. Ценник — $0,08 за минуту аудио.