Hexo Labs otvoril zdrojový kód SIA. AI agent sa má učiť aj sám zo seba
Hexo Labs predstavil open source rámec pre AI agentov s názvom SIA, teda Self Improving Agent. Nejde iba o dolaďovanie promptov a pracovných postupov. Hlavné tvrdenie je ambicióznejšie: agent analyzuje vlastné pokusy, mení svoje pracovné metódy a v prípade potreby spúšťa interné dolaďovanie modelu, aby ďalší cyklus zvládol lepšie.
Samozlepšujúci sa agent už neznamená len lepší prompt
Vývoj AI agentov sa doteraz uberal najmä dvoma smermi. V prvom vývojár alebo metaagent zlepšuje systém zvonka: prompty, výber nástrojov, logiku opakovania pokusov a stratégiu vyhľadávania. V druhom tím dolaďuje samotný model pomocou spätnej väzby z úloh. SIA spája oba prístupy do jednej slučky.
Kľúčový pojem, interné dolaďovanie modelu, znamená zmenu parametrov neurónovej siete počas tréningu. Jednoduchšie povedané, agent nedostáva iba lepšie inštrukcie. Samotný model sa učí z opakovaných chýb a výsledkov. Tým sa SIA odlišuje od agentov, ktorí len prepíšu prompt alebo pridajú ďalší krok do pracovného postupu.
Zlepšovaciu slučku riadia traja agenti
Podľa oficiálneho opisu na GitHube SIA pracuje cez tri hlavné komponenty. Meta Agent číta zadanie úlohy a vytvorí prvého cieľového agenta. Task Specific Agent rieši úlohu a zaznamenáva svoje kroky aj výsledky. Feedback Agent kontroluje záznamy, hľadá slabé miesta a rozhoduje, či zlepšiť agentovú kostru, alebo spustiť interné dolaďovanie modelu.
Technicky je toto rozlíšenie dôležité. Agentová kostra určuje, ako systém hľadá riešenie, používa nástroje a kontroluje výsledky. Interné dolaďovanie modelu má pridať doménový úsudok, ktorý sa do modelu nedá jednoducho vpísať promptom. Autori SIA v článku na arXiv uvádzajú, že spoločné použitie oboch pák prekonalo zlepšovanie samotnej kostry vo všetkých troch testovaných oblastiach.
Výsledky vyzerajú silno, no vyžadujú triezve meranie
Technický článok o SIA hodnotil rámec na troch veľmi odlišných úlohách: klasifikácii obvinení z čínskych právnych textov, nízkoúrovňovej optimalizácii GPU kernelov a odšumovaní dát jednobunkovej RNA. Takýto výber dáva systému širší test než štandardný chatbotový benchmark, pretože úlohy vyžadujú odlišné typy presnosti, experimentovania a merateľného výstupu.
Na papieri sú výsledky výrazné. Podľa autorov SIA spojil zlepšovanie kostry s interným dolaďovaním modelu a na LawBench prekonal predchádzajúci stav techniky o 25,1 percenta. GPU kernel bežal o 12,4 percenta rýchlejšie než predchádzajúci stav techniky, zatiaľ čo odšumovanie dát RNA sa zlepšilo o 20,4 percenta. Repozitár na GitHube uvádza aj 70,1-percentnú presnosť Top 1 na LawBench, 14-násobné zrýchlenie kernelu TriMul oproti východiskovému riešeniu a skóre MSE_norm 0,289 v úlohe sekvenovania jednobunkovej RNA.
Tvrdenie o „350-násobku“ je tlačová formulácia, nie nezávislý verdikt
Hexo Labs v tlačovej správe tvrdí, že SIA zrýchľuje cestu k superinteligencii 350-násobne. K tomu treba pristupovať opatrne. Firma spája tvrdenie s benchmarkom OpenAI MLE bench, no nejde o to isté ako nezávislý dôkaz, že SIA skutočne posúva AI k superinteligencii. Verejné materiály zatiaľ ukazujú niečo vecnejšie: SIA ponúka silný experimentálny rámec pre merateľné vývojové úlohy.
OpenAI opisuje MLE bench ako benchmark na testovanie, či AI agenti dokážu vykonávať prácu v oblasti inžinierstva strojového učenia: trénovať modely, pripravovať dáta a spúšťať experimenty. Obsahuje 75 súťaží strojového učenia z Kaggle a agentom dáva podstatne praktickejší cieľ než bežné benchmarky otázok a odpovedí.
Z európskeho pohľadu je najdôležitejšia transparentnosť
Pre európskych vývojárov a výskumné inštitúcie je hlavnou hodnotou SIA otvorenosť. Repozitár na GitHube ukazuje, že rámec používa licenciu MIT, je napísaný v Pythone a dá sa použiť s vlastnými úlohami, pri ktorých sú verejné vstupy, skryté vyhodnocovacie dáta a hodnotiteľ definované samostatne. Výskumníkom to pomáha opakovať experimenty a overovať, čo agent v skutočnosti mení.
Interné dolaďovanie modelu zároveň prináša väčšiu zodpovednosť. Keď agent dokáže meniť svoje správanie hlbšie, hodnotiaci rámec musí zachytiť aj to, či sa systém zlepšuje všeobecne, alebo sa iba učí využívať jednu konkrétnu metriku. Preto SIA v súčasnosti najlepšie zapadá do vedeckých a inžinierskych úloh s jasnými mierami, nie do autonómneho rozhodovania s otvorenými cieľmi.
Technický prehľad
SIA spája zlepšovanie agentovej kostry a interné dolaďovanie modelu v jednej samozlepšovacej slučke.
Systém používa Meta Agenta, Task Specific Agenta a Feedback Agenta.
Testy zahŕňali právne texty, optimalizáciu GPU kernelov a odšumovanie dát jednobunkovej RNA.
Podľa repozitára na GitHube je SIA open source, má licenciu MIT a je postavený pre Python 3.11+.
Veľké tvrdenie o „350-násobku“ pochádza z tlačovej správy Hexo Labs, nie z nezávislého auditu.
SIA nemusí byť skratkou k superinteligencii. Ponúka však niečo praktickejšie a nateraz užitočnejšie: spôsob, ako prinútiť AI agentov ukázať svoju prácu, učiť sa z nej a ísť do ďalšieho testu s niečím viac než len lepším povzbudením.