Atomic Agent твърди, че побеждава Hermes с локален AI модел
Нов open-source локален агент отчита 37 срещу 31 решени задачи спрямо Hermes в собствен тест върху GAIA Level 1.

Нов локален AI агент влиза в директно сравнение с Hermes
Конкуренцията при автономните AI агенти вече не идва само от големите облачни платформи. Atomic Agent е нов open-source проект, който поставя акцент върху локалното изпълнение и твърди, че е постигнал по-висок резултат от Hermes в конкретен тест върху GAIA Level 1.
Според публикуваните от екипа резултати Atomic Agent е решил 37 от общо 53 задачи, или 69,8%, докато Hermes е решил 31 задачи, или 58,5%. И двата агента са били свързани с един и същ локален модел — qwen-3.6-35b-a3b през llama.cpp — при еднакъв лимит на стъпките и еднакво максимално време за задача.
Какво точно означава този резултат
Това не е общо доказателство, че Atomic Agent е по-добър от Hermes във всяка ситуация. Става дума за един benchmark, едно ниво от него, конкретен локален модел и конфигурация, избрана от авторите на Atomic Agent. Резултатите и следите от изпълнението са публикувани в хранилището на проекта, но към момента няма независимо възпроизвеждане на сравнението.
Най-коректно е да гледаме на числата като на интересно твърдение на разработчиците, което показва силните страни на техния агентен цикъл, а не като на окончателна класация между двата проекта. Hermes поддържа по-широк набор от модели, инструменти, канали и работни процеси, докато Atomic Agent в момента набляга основно на ефективната работа с по-малки локални модели.
Защо локалният подход е интересен
Atomic Agent работи с Qwen, Gemma и Llama чрез модифициран вариант на llama.cpp. Проектът използва стабилен префикс на prompt-а, ограничен контекст и компресиране на KV cache. Авторите твърдят, че TurboQuant може да намали размера на кеша до 6,4 пъти спрямо F16 и да увеличи производителността при някои малки модели.
Основното предимство на локалното изпълнение е контролът. Сесиите, паметта и конфигурацията могат да останат на компютъра на потребителя, а за самия модел няма такса за всеки използван токен. Това не означава нулев разход — нужни са подходящ хардуер, електричество и време за настройка. Мрежови заявки също могат да напуснат устройството, когато агентът отваря сайтове или използва външни услуги.
Какво може Atomic Agent
Проектът предлага браузърна автоматизация, работа с файлове и терминал, памет, задачи по график, MCP интеграции и управление през Telegram. Предлага се за macOS, Windows и Linux, но е обозначен като developer preview. Това означава, че интерфейсите и поведението все още могат да се променят.
Добра новина за open-source екосистемата
Независимо кой печели конкретния тест, появата на още един активен open-source агент е добра новина. Публичните сравнения, trace логовете и възможността други хора да повторят експериментите създават по-силна конкуренция. А когато проектите се опитват да бъдат по-ефективни с локални модели, печелят и потребителите, които не искат всяка задача да минава през скъп облачен модел.
Следващата важна стъпка е независима проверка на публикуваните резултати и сравнение в повече реални задачи, модели и хардуерни конфигурации.


