DeepSeek V4 Flash срещу Kimi и GLM: една задача разлика, до 17 пъти по-ниска цена

Нов тест сравнява три open модели върху 30 агентни задачи и показва колко важни стават скоростта и цената.

DeepSeek V4 Flash срещу Kimi и GLM: една задача разлика, до 17 пъти по-ниска цена

Кой е най-добрият open AI модел? Ако гледаме само броя решени задачи, отговорът тук е почти равен. Ако погледнем цената и времето — вече не е.

Публикация в X сравнява DeepSeek V4 Flash, Kimi K3 и GLM 5.2 върху 30 трудни агентни задачи. DeepSeek решава 20, а другите два модела — по 21. Разликата е една задача, или около 3.3 процентни пункта успеваемост.

След това идват числата, които наистина привличат вниманието.

Цена и скорост

Според графиката средната цена на задача е $0.08 при DeepSeek, $1.39 при Kimi и $0.57 при GLM. Това прави DeepSeek около 17.4 пъти по-евтин от Kimi и 7.1 пъти по-евтин от GLM.

При времето картината е подобна: 164 секунди за DeepSeek, 226 за Kimi и 419 за GLM. Тоест DeepSeek е приблизително 2.55 пъти по-бърз от GLM и 1.38 пъти по-бърз от Kimi в този конкретен тест.

Това е сериозна разлика. Особено ако моделът ще изпълнява не една задача, а хиляди.

„Същото качество“ ли е това

Не точно. DeepSeek решава 20 задачи, а Kimi и GLM — 21. Резултатите са близки, но не идентични. По-коректно е да кажем, че DeepSeek предлага почти същата успеваемост при значително по-ниска цена и по-кратко време.

Има и по-важно уточнение: публикацията и графиката не дават достатъчно подробна независима методология. Не виждаме пълните prompts, повторенията, raw traces, условията за оценяване или дали резултатът е възпроизведен от друг екип. Не можем да пресметнем независимо и „estimated cost“, защото не са посочени API доставчикът, датата на тарифите и разделението между input, output и cached tokens.

Затова това не е доказателство, че DeepSeek винаги ще бъде по-бърз или по-евтин. Хардуерът, доставчикът, дължината на отговора и конкретният агентен harness могат да променят сметката.

Новият benchmark е полезността

Въпреки ограниченията сравнението задава правилния въпрос. Един модел не е ценен само защото решава най-много задачи. Важни са времето, цената и колко лесно можем да го използваме многократно.

Когато успеваемостта е близка, икономиката започва да решава. И точно там DeepSeek изглежда най-интересен в този тест.

Сподели:👤🐦💼