Hexo Labs открыла исходный код SIA, ИИ-агента с самообучением
Hexo Labs представила открытый фреймворк ИИ-агента SIA, Self Improving Agent. Он не просто улучшает промпты и рабочие процессы. Главная заявка проекта шире: агент анализирует собственные попытки, меняет методы работы и при необходимости запускает внутреннюю донастройку модели, чтобы лучше пройти следующий цикл.
Самоулучшающийся агент больше не сводится к более удачному промпту
Разработка ИИ-агентов до сих пор шла по двум основным направлениям. В одном случае разработчик или метаагент улучшает систему снаружи: промпты, выбор инструментов, логику повторных попыток и стратегию поиска. В другом команда донастраивает саму модель, используя обратную связь по задачам. SIA объединяет оба подхода в одном цикле.
Ключевой термин здесь, внутренняя донастройка модели, означает изменение параметров нейросети во время обучения. Проще говоря, агент получает не только более точные инструкции. Сама модель учится на повторяющихся ошибках и результатах. Это отличает SIA от агентов, которые лишь переписывают промпт или добавляют еще один шаг в рабочий процесс.
Цикл улучшения держится на трех агентах
Согласно официальному описанию на GitHub, SIA работает через три основных компонента. Meta Agent читает описание задачи и создает первого целевого агента. Task Specific Agent решает задачу и фиксирует свои действия и результаты. Feedback Agent изучает логи, выявляет слабые места и решает, нужно ли улучшить каркас агента или запустить внутреннюю донастройку модели.
Технически это важное различие. Каркас агента определяет, как система ищет решение, использует инструменты и проверяет результаты. Внутренняя донастройка модели должна добавлять предметное суждение, которое нельзя просто «вписать» в модель промптом. В статье на arXiv авторы SIA утверждают, что совместное использование обоих рычагов превзошло улучшение только каркаса во всех трех протестированных областях.
Результаты выглядят сильными, но требуют трезвой оценки
В технической статье о SIA фреймворк оценивали на трех очень разных задачах: классификации обвинений по китайским юридическим текстам, низкоуровневой оптимизации GPU-ядер и подавлении шума в данных РНК одиночных клеток. Такой набор дает системе более широкий тест, чем стандартный бенчмарк чат-бота, поскольку задачи требуют разных типов точности, экспериментов и измеримого результата.
На бумаге показатели заметные. По данным авторов, SIA объединила улучшение каркаса с внутренней донастройкой модели и превзошла прежний уровень state of the art на LawBench на 25,1%. GPU-ядро работало на 12,4% быстрее прежнего state of the art, а подавление шума в данных РНК улучшилось на 20,4%. В репозитории GitHub также указаны точность Top 1 на LawBench в 70,1%, ускорение TriMul-ядра в 14 раз относительно базовой линии и показатель MSE_norm 0,289 в задаче секвенирования РНК одиночных клеток.
Заявление о «350 разах» звучит как пресс-тезис, а не как независимый вердикт
В пресс-релизе Hexo Labs утверждает, что SIA ускоряет путь к сверхинтеллекту в 350 раз. К этому стоит относиться осторожно. Компания связывает заявление с MLE bench от OpenAI, но это не то же самое, что независимое доказательство того, что SIA действительно продвигает ИИ к сверхинтеллекту. Публичные материалы пока показывают более приземленную картину: SIA предлагает сильный экспериментальный фреймворк для измеримых задач разработки.
OpenAI описывает MLE bench как бенчмарк для проверки того, способны ли ИИ-агенты выполнять работу инженера машинного обучения: обучать модели, готовить данные и проводить эксперименты. Он включает 75 соревнований Kaggle по машинному обучению и дает агентам гораздо более практическую цель, чем обычные бенчмарки вопросов и ответов.
Для Европы важнее всего прозрачность
Для европейских разработчиков и исследовательских институтов главная ценность SIA заключается в открытости. Репозиторий GitHub показывает, что фреймворк использует лицензию MIT, написан на Python и может применяться с пользовательскими задачами, где публичные входные данные, скрытые оценочные данные и оценщик задаются отдельно. Это помогает исследователям повторять эксперименты и проверять, что именно меняет агент.
В то же время внутренняя донастройка модели требует большей ответственности. Когда агент может глубже менять свое поведение, система оценки должна также выявлять, становится ли система в целом лучше или лишь учится использовать особенности конкретной метрики. Поэтому сейчас SIA лучше всего подходит для научных и инженерных задач с четкими показателями, а не для автономного принятия решений с открытыми целями.
Техническая справка
SIA объединяет улучшение каркаса агента и внутреннюю донастройку модели в одном цикле самоулучшения.
Система использует Meta Agent, Task Specific Agent и Feedback Agent.
Испытания охватывали юридические тексты, оптимизацию GPU-ядер и подавление шума в данных РНК одиночных клеток.
Согласно репозиторию GitHub, SIA является проектом с открытым исходным кодом, распространяется по лицензии MIT и рассчитана на Python 3.11+.
Крупное заявление о «350 разах» взято из пресс-релиза Hexo Labs, а не из независимого аудита.
SIA может и не быть коротким путем к сверхинтеллекту. Зато она предлагает нечто более практичное и пока более полезное: способ заставить ИИ-агентов показывать ход своей работы, учиться на нем и подходить к следующей проверке не только с более удачной мотивирующей установкой.