Meta AIRA₃: когато AI агентите започнат да работят като изследователски екип
AIRA₃ координира много AI агенти и според Meta стига до 8-о място в Kaggle. Какво всъщност показва резултатът?

Meta показа следващото поколение на своята система за автономни AI изследвания AIRA₃. Идеята звучи по-различно от обичайния разговор за „по-умен модел“: вместо един централен агент да прави всичко, множество дълго работещи агенти изследват задачата паралелно, споделят хипотези и файлове и надграждат най-обещаващите резултати.
Реален тест, а не подбрана демонстрация
Компанията е тествала подхода в Kaggle състезание на NVIDIA. Задачата е била да се подобри способността за разсъждение на 30-милиарден Nemotron модел, като всички участници са разполагали с еднаква информация, а финалните решения са били оценявани върху скрит тестов набор.
Според Meta AIRA₃ е завършила на осмо място сред приблизително 4 000 отбора и е влязла в зоната за златен медал. Това е впечатляващ резултат, но трябва да се прочете правилно.
Не е нов „супермодел“ на Meta
AIRA₃ не е нов фундаментален модел, който сам е победил хиляди хора. В най-силната конфигурация системата е координирала комбинация от GPT 5.5 с OpenCode и Claude 4.8 с Claude Code. След края на състезанието Meta е тествала и други конфигурации: Muse Spark 1.2 е достигнал резултат на ниво златен медал, а Muse Spark 1.1 и GLM 5.2 — на ниво сребърен медал. Тези допълнителни резултати също са били оценени върху частния тестов набор, но не са официални участия на живо.
Как работи системата? Всеки агент получава собствена изолирана среда. Вместо централен „шеф“ агентите използват две общи пространства: форум за хипотези и открития и споделена файлова система за решенията и артефактите. Така един агент може да открие добра посока, а друг да я провери, развие или отхвърли.
Следващата стъпка: по-добра организация, не само по-големи модели
Това е интересната промяна. През последните години напредъкът идваше основно от по-големи модели и повече данни. AIRA₃ показва друг път: съществуващи модели могат да станат по-полезни, когато бъдат организирани като екип, работят достатъчно дълго и натрупват общо знание.
Meta съобщава и за вътрешни тестове извън състезанието — 27% по-ниска латентност при production GPU kernels и резултат на ниво златен медал в Kaggle задача за превод на акадски глинени плочки. Тези числа обаче са представени от самата компания и засега не трябва да се приемат като универсален benchmark за автономна наука.
Най-точният извод не е, че AI вече е заменил изследователите. По-скоро виждаме система, която може да организира много модели и coding агенти така, че да изследват тесен, добре измерим проблем на ниво, сравнимо с добри човешки екипи. Следващият голям въпрос е дали същият подход ще работи толкова добре при по-отворени задачи, където няма ясна метрика и скрит тестов набор.


