Andon Labs поставила AI-агентов управлять реальными бизнесами — и показала разрыв между умением и надёжностью
Реальные магазины и кафе помогают Andon Labs находить неожиданные сбои AI-агентов, но пока не позволяют отделить ошибки модели от влияния программной среды и людей.
🔴 Andon Labs поставила AI-агентов управлять реальными бизнесами — и показала разрыв между умением и надёжностью
Компания по безопасности ИИ Andon Labs проверяет AI-агентов на реальных предприятиях: они распоряжаются бюджетом, заказывают товары и дают задания сотрудникам. Эксперименты должны показать, сколько ответственности можно доверить нынешним моделям. Предварительный ответ: отдельные поручения им удаются лучше, чем длительное управление.
В стокгольмском Andon Café менеджер на базе Gemini свободно закупал свежие продукты, часть которых портилась. После перехода на GPT агент чрезмерно сократил расходы: отказался от скоропортящихся продуктов и свёл меню к сырным тостам из замороженного хлеба и долго хранящегося сыра. Система решила проблему отходов, но создала другую — меню, не рассчитанное на реальный спрос.
В магазине Andon Market в Сан-Франциско Luna отслеживает поставки и общается с продавцами, а физическую работу выполняют сотрудники. Агент раз за разом принимает крышку встроенной в пол розетки за незакреплённую подставку и просит убрать её; сотрудник иногда игнорирует команды, чтобы не оставлять зал без присмотра. Это одновременно показывает пользу человеческого контроля и мешает оценке: успех или ошибку трудно приписать отдельно модели, окружающей программе либо людям.
Сооснователь Andon Лукас Петерссон поэтому называет опыт с одним магазином в неконтролируемых условиях «слабой наукой». Компания намерена переносить найденные сбои в цифровые двойники и воспроизводить их в симуляции, однако исследователь Принстона Саяш Капур предупреждает, что такие модели пока плохо передают поведение людей и организаций. Реальный бизнес помогает обнаружить неожиданный провал, но ещё не показывает, насколько часто он повторяется и что именно его вызвало. Поэтому автономность здесь остаётся не свойством агента, а допущением, которое постоянно поддерживают люди.
Этот материал подготовлен командой AI-агентов AravanaAI и проверен главным редактором. #ИИ #AIAgents #Бизнес #Надёжность #БезопасностьИИ #AravanaAI
Хотите получать подобные материалы раньше?
Aravana Intelligence — авторская аналитика и закрытый круг для тех, кто думает на шаг вперёд.
Узнать про IntelligenceНе пропускайте важное
Еженедельный дайджест Aravana — ключевые события в AI, робототехнике и longevity.
🔴 Insight Partners не ставит всё на OpenAI и Anthropic — хотя те привлекли половину венчурных денег
Девен Парех видит в стремительном росте оценок возвращение риска 2021 года и предпочитает ранние небольшие вложения одной крупной ставке на лидера.
🔴 SoftBank взял $11,87 млрд у 20 банков для ставки на OpenAI
Японский холдинг расширил двухлетний кредит до $11,87 млрд и перестраивает долговое финансирование ради вложений в OpenAI почти на $65 млрд.
Z.ai снова идёт за капиталом: $5 млрд на фоне дорогой гонки моделей
Разработчик GLM сочетает размещение акций с конвертируемым долгом, пока расходы на исследования более чем вдвое превышают выручку.