Qwen срещу GPT и Claude: една игра, един prompt и огромна разлика в цената

Три водещи AI модела правят една и съща игра, а резултатът показва защо цената вече е част от качеството.

Qwen срещу GPT и Claude: една игра, един prompt и огромна разлика в цената

Колко струва една добра AI идея? Понякога разликата не е в крайния резултат, а в сметката след него.

Command Code поставя Qwen3.8-Max, GPT-5.6 Sol и Opus 5 пред една и съща задача: да създадат работеща игра с един prompt и one-shot `/design` команда. Видеото показва трите резултата едновременно, така че разликите в интерфейса, стила и поведението могат да се видят директно.

Авторът оценява Qwen и GPT с по 9 от 10, а Opus — с 8.5. Това звучи като почти равен резултат. При цената обаче картината се променя: $0.0248 за Qwen, $0.150 за GPT-5.6 Sol и $0.253 за Opus 5.

Какво показват числата

По собствените данни на публикацията Qwen излиза около шест пъти по-евтин от GPT и малко над десет пъти по-евтин от Opus. Това е повече от любопитна подробност. При една задача разликата е стотинки, но при стотици автоматични итерации, агентни workflows или генериране на варианти тя може да се превърне в сериозен бюджет.

В оригиналния X текст има и обобщение за „4.2 пъти по-евтино“, което не съвпада с публикуваните разходи. Затова тук използваме директно съотношенията между показаните числа.

Но това не е лабораторен benchmark

Тестът е проведен и оценен от Command Code. Няма независима комисия, публикуван точен prompt, предварително описана scoring rubric, token/cache данни, настройки за reasoning effort, моделни snapshots или сурови run logs. Оценките за gameplay, UX и UI неизбежно съдържат субективна преценка.

И това е напълно нормално за демонстрация. Просто не трябва да я превръщаме в присъда, че един модел е „по-добър изобщо“.

Различен prompt, по-дълга задача или изискване за поддръжка на създадения код могат да дадат друг победител. Но видеото илюстрира важна тенденция: frontier резултатите вече не идват само от най-скъпия модел.

Истинският въпрос е стойността

Преди година разговорът беше основно кой модел печели benchmark таблицата. Днес все по-често питаме нещо по-практично: колко полезен резултат получаваме за всеки похарчен долар?

Точно тук по-евтините модели могат да променят начина, по който изграждаме AI продукти. Не защото винаги са най-добрите, а защото позволяват повече опити, по-бърза итерация и по-нисък риск.

Сподели:👤🐦💼