🔴 ИИ-исследователь Anthropic улучшил модель по 10 тестам — и на этом участке обошёл людей

Автоматизированная система улучшила модель по всем десяти поведенческим тестам, но результат зависит от того, насколько точно сами тесты отражают цели настройки.

Aravana··1 мин

🔴 ИИ-исследователь Anthropic улучшил модель по 10 тестам — и на этом участке обошёл людей

ИИ уже поручают искать способы улучшить другую модель. В пересказе новой работы Anthropic TechCrunch сообщает: автоматические системы получили десять тестов на конкретные нежелательные типы поведения и улучшили результат по каждому, не ухудшив общую производительность модели.

Цикл похож на работу исследовательской группы: система изучает публикации, предлагает метод и обучает модель 30 минут. После нескольких итераций удачные подходы сохраняются, неудачные отбрасываются. Лучший метод в среднем за шесть часов превзошёл предложения опытных специалистов; заданные людьми направления более сильного результата не дали. Стоимость оценили в $4 за час API-инференса против $150 за час работы исследователя.

Это ещё не рекурсивное самоулучшение модели, а более узкий результат: автоматизация постобучения по заданным тестам. Авторы называют его ранним свидетельством того, что такая настройка вскоре может стать практически применимой.

Главное ограничение заложено в самой цели: система полезна лишь настолько, насколько тесты отражают нужное поведение. Их всё ещё должны создавать и поддерживать люди — как и базу публикаций, на которой работает автоматический исследователь. Машина уже может выиграть в переборе методов, но доказать, что она улучшает именно нужное свойство, ей пока нечем.

Этот материал подготовлен командой AI-агентов AravanaAI и проверен главным редактором.

#ИИ #Anthropic #AISafety #МашинноеОбучение #AravanaAI

Тип материала: Пост из Telegram

Поделиться:TelegramXLinkedIn
Как вам материал?

Хотите получать подобные материалы раньше?

Aravana Intelligence — авторская аналитика и закрытый круг для тех, кто думает на шаг вперёд.

Узнать про Intelligence

Не пропускайте важное

Еженедельный дайджест Aravana — ключевые события в AI, робототехнике и longevity.

Похожие материалы

Один исследователь натравил Claude на Google — и заработал $500 000 за три месяца

Исследователь дал Claude три простых инструмента — и AI нашёл в инфраструктуре Google полторы тысячи уязвимых API за квартал.

·1 мин

Google поймал первый случай: AI написал код атаки, который реально сработал

Google Threat Intelligence задокументировал первый в истории случай, когда боевой код взлома написала языковая модель — и эксплойт сработал в реальной атаке.

·1 мин