Hexo Labs otevírá zdrojový kód SIA, agenta AI, který se dál učí sám
Hexo Labs představila open source framework pro agenty AI s názvem SIA, tedy Self Improving Agent. Nejde jen o vylepšování promptů a pracovních postupů. Hlavní tvrzení je ambicióznější: agent analyzuje vlastní pokusy, mění své pracovní metody a v případě potřeby spouští interní dolaďování modelu, aby další cyklus zvládl lépe.
Samo se zlepšující agent už neznamená jen lepší prompt
Vývoj agentů AI se dosud ubíral hlavně dvěma cestami. V jedné vývojář nebo metaagent vylepšuje systém zvenčí: prompty, volbu nástrojů, logiku opakování a strategii vyhledávání. Ve druhé tým dolaďuje samotný model pomocí zpětné vazby z úloh. SIA spojuje oba přístupy do jedné smyčky.
Klíčový pojem, interní dolaďování modelu, znamená změnu parametrů neuronové sítě během tréninku. Jednodušeji řečeno, agent nedostává jen lepší instrukce. Samotný model se učí z opakovaných chyb a výsledků. Tím se SIA liší od agentů, kteří pouze přepisují prompt nebo přidají další krok do pracovního postupu.
Smyčku zlepšování řídí tři agenti
Podle oficiálního popisu na GitHubu SIA pracuje se třemi hlavními komponentami. Meta Agent čte zadání úlohy a vytváří prvního cílového agenta. Task Specific Agent úlohu řeší a zaznamenává své kroky i výsledky. Feedback Agent prochází logy, odhaluje slabiny a rozhoduje, zda vylepšit agentní kostru, nebo spustit interní dolaďování modelu.
Z technického pohledu je toto rozlišení důležité. Agentní kostra určuje, jak systém hledá řešení, používá nástroje a kontroluje výsledky. Interní dolaďování modelu má přidat doménový úsudek, který do modelu nelze jednoduše vepsat promptem. Autoři SIA v článku na arXiv uvádějí, že kombinace obou pák překonala ve všech třech testovaných oblastech zlepšování založené pouze na kostře.
Výsledky vypadají silně, vyžadují ale střízlivé měření
Technická studie SIA hodnotila framework na třech velmi odlišných úlohách: klasifikaci obvinění z čínských právních textů, optimalizaci nízkoúrovňového GPU kernelu a odšumování jednobuněčných RNA dat. Takový výběr dává systému širší prověrku než běžný benchmark chatbotů, protože úlohy vyžadují různé typy přesnosti, experimentování a měřitelných výstupů.
Na papíře jsou výsledky výrazné. Podle autorů SIA zkombinovala vylepšování kostry s interním dolaďováním modelu a na LawBench překonala dosavadní state of the art o 25,1 procenta. GPU kernel běžel o 12,4 procenta rychleji než dosavadní state of the art, zatímco odšumování RNA dat se zlepšilo o 20,4 procenta. Repozitář na GitHubu uvádí také přesnost Top 1 na LawBench ve výši 70,1 procenta, čtrnáctinásobné zrychlení kernelu TriMul proti baseline a skóre MSE_norm 0,289 v úloze sekvenování jednobuněčné RNA.
Tvrzení o „350násobku“ je tisková formulace, ne nezávislý verdikt
Hexo Labs v tiskové zprávě uvádí, že SIA 350krát urychluje cestu k superinteligenci. To je třeba brát opatrně. Firma tvrzení spojuje s benchmarkem OpenAI MLE bench, nejde však o totéž jako nezávislý důkaz, že SIA skutečně posouvá AI k superinteligenci. Veřejně dostupné materiály zatím ukazují něco pevněji uchopitelného: SIA nabízí silný experimentální framework pro měřitelné vývojové úlohy.
OpenAI popisuje MLE bench jako benchmark pro testování, zda agenti AI dokážou vykonávat práci v oblasti strojového učení: trénovat modely, připravovat data a spouštět experimenty. Obsahuje 75 soutěží ve strojovém učení z Kaggle a dává agentům mnohem praktičtější cíl než běžné benchmarky otázek a odpovědí.
Z evropského pohledu je nejdůležitější transparentnost
Pro evropské vývojáře a výzkumné instituce má SIA hlavní hodnotu v otevřenosti. Repozitář na GitHubu ukazuje, že framework používá licenci MIT, je napsaný v Pythonu a lze jej využít s vlastními úlohami, u nichž se veřejné vstupy, skrytá evaluační data a hodnotitel definují odděleně. To výzkumníkům pomáhá opakovat experimenty a kontrolovat, co agent skutečně mění.
Interní dolaďování modelu zároveň přináší větší odpovědnost. Když agent dokáže měnit své chování hlouběji, musí evaluační rámec zachytit také to, zda se systém obecně zlepšuje, nebo se jen učí využít jednu konkrétní metriku. Proto se SIA nyní hodí hlavně pro vědecké a inženýrské úlohy s jasnými měřítky, nikoli pro autonomní rozhodování s otevřenými cíli.
Technický přehled
SIA kombinuje vylepšování agentní kostry a interní dolaďování modelu v jedné smyčce samostatného zlepšování.
Systém používá Meta Agent, Task Specific Agent a Feedback Agent.
Testy zahrnovaly právní texty, optimalizaci GPU kernelu a odšumování jednobuněčných RNA dat.
Podle repozitáře na GitHubu je SIA open source, má licenci MIT a je postavená pro Python 3.11+.
Velké tvrzení o „350násobku“ pochází z tiskové zprávy Hexo Labs, nikoli z nezávislého auditu.
SIA nemusí být zkratkou k superinteligenci. Nabízí něco praktičtějšího a prozatím užitečnějšího: způsob, jak přimět agenty AI ukázat svou práci, poučit se z ní a jít do další zkoušky s něčím víc než jen s lepším povzbuzením.