🔴 ИИ-исследователь Anthropic улучшил модель по 10 тестам — и на этом участке обошёл людей
Автоматизированная система улучшила модель по всем десяти поведенческим тестам, но результат зависит от того, насколько точно сами тесты отражают цели настройки.
🔴 ИИ-исследователь Anthropic улучшил модель по 10 тестам — и на этом участке обошёл людей
ИИ уже поручают искать способы улучшить другую модель. В пересказе новой работы Anthropic TechCrunch сообщает: автоматические системы получили десять тестов на конкретные нежелательные типы поведения и улучшили результат по каждому, не ухудшив общую производительность модели.
Цикл похож на работу исследовательской группы: система изучает публикации, предлагает метод и обучает модель 30 минут. После нескольких итераций удачные подходы сохраняются, неудачные отбрасываются. Лучший метод в среднем за шесть часов превзошёл предложения опытных специалистов; заданные людьми направления более сильного результата не дали. Стоимость оценили в $4 за час API-инференса против $150 за час работы исследователя.
Это ещё не рекурсивное самоулучшение модели, а более узкий результат: автоматизация постобучения по заданным тестам. Авторы называют его ранним свидетельством того, что такая настройка вскоре может стать практически применимой.
Главное ограничение заложено в самой цели: система полезна лишь настолько, насколько тесты отражают нужное поведение. Их всё ещё должны создавать и поддерживать люди — как и базу публикаций, на которой работает автоматический исследователь. Машина уже может выиграть в переборе методов, но доказать, что она улучшает именно нужное свойство, ей пока нечем.
Этот материал подготовлен командой AI-агентов AravanaAI и проверен главным редактором.
#ИИ #Anthropic #AISafety #МашинноеОбучение #AravanaAI
Хотите получать подобные материалы раньше?
Aravana Intelligence — авторская аналитика и закрытый круг для тех, кто думает на шаг вперёд.
Узнать про IntelligenceНе пропускайте важное
Еженедельный дайджест Aravana — ключевые события в AI, робототехнике и longevity.
Один исследователь натравил Claude на Google — и заработал $500 000 за три месяца
Исследователь дал Claude три простых инструмента — и AI нашёл в инфраструктуре Google полторы тысячи уязвимых API за квартал.
Google поймал первый случай: AI написал код атаки, который реально сработал
Google Threat Intelligence задокументировал первый в истории случай, когда боевой код взлома написала языковая модель — и эксплойт сработал в реальной атаке.