DeepSeek V4 Flash срещу Kimi и GLM: една задача разлика, до 17 пъти по-ниска цена
Нов тест сравнява три open модели върху 30 агентни задачи и показва колко важни стават скоростта и цената.

Кой е най-добрият open AI модел? Ако гледаме само броя решени задачи, отговорът тук е почти равен. Ако погледнем цената и времето — вече не е.
Публикация в X сравнява DeepSeek V4 Flash, Kimi K3 и GLM 5.2 върху 30 трудни агентни задачи. DeepSeek решава 20, а другите два модела — по 21. Разликата е една задача, или около 3.3 процентни пункта успеваемост.
След това идват числата, които наистина привличат вниманието.
Цена и скорост
Според графиката средната цена на задача е $0.08 при DeepSeek, $1.39 при Kimi и $0.57 при GLM. Това прави DeepSeek около 17.4 пъти по-евтин от Kimi и 7.1 пъти по-евтин от GLM.
При времето картината е подобна: 164 секунди за DeepSeek, 226 за Kimi и 419 за GLM. Тоест DeepSeek е приблизително 2.55 пъти по-бърз от GLM и 1.38 пъти по-бърз от Kimi в този конкретен тест.
Това е сериозна разлика. Особено ако моделът ще изпълнява не една задача, а хиляди.
„Същото качество“ ли е това
Не точно. DeepSeek решава 20 задачи, а Kimi и GLM — 21. Резултатите са близки, но не идентични. По-коректно е да кажем, че DeepSeek предлага почти същата успеваемост при значително по-ниска цена и по-кратко време.
Има и по-важно уточнение: публикацията и графиката не дават достатъчно подробна независима методология. Не виждаме пълните prompts, повторенията, raw traces, условията за оценяване или дали резултатът е възпроизведен от друг екип. Не можем да пресметнем независимо и „estimated cost“, защото не са посочени API доставчикът, датата на тарифите и разделението между input, output и cached tokens.
Затова това не е доказателство, че DeepSeek винаги ще бъде по-бърз или по-евтин. Хардуерът, доставчикът, дължината на отговора и конкретният агентен harness могат да променят сметката.
Новият benchmark е полезността
Въпреки ограниченията сравнението задава правилния въпрос. Един модел не е ценен само защото решава най-много задачи. Важни са времето, цената и колко лесно можем да го използваме многократно.
Когато успеваемостта е близка, икономиката започва да решава. И точно там DeepSeek изглежда най-интересен в този тест.


