Andon Labs поставила AI-агентов управлять реальными бизнесами — и показала разрыв между умением и надёжностью

Реальные магазины и кафе помогают Andon Labs находить неожиданные сбои AI-агентов, но пока не позволяют отделить ошибки модели от влияния программной среды и людей.

Aravana··1 мин

🔴 Andon Labs поставила AI-агентов управлять реальными бизнесами — и показала разрыв между умением и надёжностью

Компания по безопасности ИИ Andon Labs проверяет AI-агентов на реальных предприятиях: они распоряжаются бюджетом, заказывают товары и дают задания сотрудникам. Эксперименты должны показать, сколько ответственности можно доверить нынешним моделям. Предварительный ответ: отдельные поручения им удаются лучше, чем длительное управление.

В стокгольмском Andon Café менеджер на базе Gemini свободно закупал свежие продукты, часть которых портилась. После перехода на GPT агент чрезмерно сократил расходы: отказался от скоропортящихся продуктов и свёл меню к сырным тостам из замороженного хлеба и долго хранящегося сыра. Система решила проблему отходов, но создала другую — меню, не рассчитанное на реальный спрос.

В магазине Andon Market в Сан-Франциско Luna отслеживает поставки и общается с продавцами, а физическую работу выполняют сотрудники. Агент раз за разом принимает крышку встроенной в пол розетки за незакреплённую подставку и просит убрать её; сотрудник иногда игнорирует команды, чтобы не оставлять зал без присмотра. Это одновременно показывает пользу человеческого контроля и мешает оценке: успех или ошибку трудно приписать отдельно модели, окружающей программе либо людям.

Сооснователь Andon Лукас Петерссон поэтому называет опыт с одним магазином в неконтролируемых условиях «слабой наукой». Компания намерена переносить найденные сбои в цифровые двойники и воспроизводить их в симуляции, однако исследователь Принстона Саяш Капур предупреждает, что такие модели пока плохо передают поведение людей и организаций. Реальный бизнес помогает обнаружить неожиданный провал, но ещё не показывает, насколько часто он повторяется и что именно его вызвало. Поэтому автономность здесь остаётся не свойством агента, а допущением, которое постоянно поддерживают люди.

Этот материал подготовлен командой AI-агентов AravanaAI и проверен главным редактором. #ИИ #AIAgents #Бизнес #Надёжность #БезопасностьИИ #AravanaAI

Тип материала: Пост из Telegram

Поделиться:TelegramXLinkedIn
Как вам материал?

Хотите получать подобные материалы раньше?

Aravana Intelligence — авторская аналитика и закрытый круг для тех, кто думает на шаг вперёд.

Узнать про Intelligence

Не пропускайте важное

Еженедельный дайджест Aravana — ключевые события в AI, робототехнике и longevity.

Похожие материалы

🔴 Insight Partners не ставит всё на OpenAI и Anthropic — хотя те привлекли половину венчурных денег

Девен Парех видит в стремительном росте оценок возвращение риска 2021 года и предпочитает ранние небольшие вложения одной крупной ставке на лидера.

·1 мин

🔴 SoftBank взял $11,87 млрд у 20 банков для ставки на OpenAI

Японский холдинг расширил двухлетний кредит до $11,87 млрд и перестраивает долговое финансирование ради вложений в OpenAI почти на $65 млрд.

·1 мин

Z.ai снова идёт за капиталом: $5 млрд на фоне дорогой гонки моделей

Разработчик GLM сочетает размещение акций с конвертируемым долгом, пока расходы на исследования более чем вдвое превышают выручку.

·1 мин