AI моделите вече могат да „мислят“ заедно, без да си пишат думи
Mostik свързва голям и малък AI модел чрез вътрешни представяния, без междинен текст — обещаващ, но все още ранен подход за по-евтин AI.

Повечето AI системи днес комбинират модели по сравнително прост начин: единият генерира текст, а другият прочита този текст и продължава работата. Това е разбираемо, но има цена. За да стигне до няколко изречения, езиковият модел вече е извършил много повече вътрешни изчисления, отколкото виждаме в крайния отговор. Когато предаде само текста, голяма част от тази информация се губи.
Новият стартъп Mostik предлага различен подход. Вместо моделите да си говорят с думи, между тях се поставя обучен „мост“, който превежда вътрешните представяния на единия модел във формат, разбираем за другия. Самите модели остават замразени — техните параметри не се дообучават. Обучава се само връзката между тях.
Големият модел чете, малкият отговаря
В показаната демонстрация екипът свързва два различни open-weight модела: GLM-5.2 с 753 милиарда параметъра и Qwen-3.5 с 4 милиарда параметъра. Големият модел прочита задачата и обработва контекста, но не генерира крайния текст. Неговото скрито състояние преминава през моста, след което малкият модел създава отговора.
Това е важно, защото генерирането дума по дума е една от скъпите части на работата. Ако големият модел може да се използва като „съветник“, без сам да пише целия отговор, част от сметката може да бъде спестена.
Според техническото описание на Mostik свързаната система затваря 50% от разликата в резултатите между малкия и големия модел. Спрямо единичен модел, който достига сходен резултат, екипът твърди, че подходът използва 2,5 пъти по-малко изчислителен ресурс. WIRED описва същата демонстрация като система, която струва около една двадесета от използването на пълния голям модел, но има резултат по средата между двата.
Защо идеята е интересна
AI индустрията дълго следваше логиката „по-голям модел = по-силен модел“. Mostik предлага друга възможност: различни модели да се специализират и да комбинират силните си страни на ниво вътрешни представяния, а не само чрез текстови инструкции.
Ако методът работи надеждно в повече задачи, той би могъл да помогне на компании да използват мощен модел само там, където наистина е нужен, а по-малък и евтин модел да върши останалата работа. Това може да намали разходите и зависимостта от един-единствен доставчик.
Има и научен въпрос. Фактът, че два модела от различни семейства могат да бъдат свързани без промяна на собствените им параметри, подсказва, че вътрешните им представяния може да имат преводима обща структура. Това би могло да помогне и за по-доброто разбиране на начина, по който езиковите модели обработват информация.
Какво още не знаем
Тук е важно да не бързаме с големи заключения. Показаните резултати идват от самата компания, а публичен научен труд, код или достатъчно подробен независим benchmark все още не са представени. Оригиналният X пост използва и по-силни формулировки за точност и скорост, които не съвпадат напълно с по-подробните числа на сайта.
Mostik споменава и силно представяне в ARC-AGI 3, но отказва да даде подробности, докато състезанието продължава. Това означава, че засега имаме обещаваща ранна демонстрация, а не окончателно доказана нова архитектура за масова употреба.
Въпреки това идеята заслужава внимание. Следващият скок в AI може да не дойде само от още по-големи модели. Възможно е да дойде и от това как вече съществуващите модели споделят работа и „мислят“ заедно.


