Най-подходящите AI модели за NVIDIA DGX Spark през август 2026
Практически тестове показват какви големи AI модели могат да работят локално върху един до четири NVIDIA DGX Spark устройства.

Локален AI с милион токена контекст вече не означава задължително огромна сървърна зала. Понякога означава една малка кутия на бюрото — стига тази кутия да е NVIDIA DGX Spark.
Mia AI Lab публикува практичен списък с модели, които е тествала върху конфигурации от едно до четири DGX Spark устройства. Това не е официална класация на NVIDIA, а работеща отправна точка за хората, които искат силен локален модел без облачен API.
Един DGX Spark
Основната препоръка е DeepSeek V4 Flash с контекст до 1 милион токена и измерена скорост около 26 tok/s. Това не е светкавично бързо, но е впечатляващо за модел от този клас върху едно компактно устройство.
В списъка присъстват и Qwen 3.6 35B NVFP4 с 256K контекст и около 81 tok/s, както и 27B вариант с около 33 tok/s. Тук quantization-ът е ключов — NVFP4 позволява голям модел да се побере в наличната памет, но точността и скоростта зависят от runtime-а.
Авторката споменава и бъдещ Qwen 3.8 27B, който според нея може да промени препоръката. Този модел обаче е описан като предстоящ, а не като вече наличен избор.
Два Spark-а — практичният sweet spot
При cluster от две устройства DeepSeek V4 Flash 0731 достига около 82 tok/s в тестовете на Mia. Това е конфигурацията, която тя препоръчва най-силно.
Алтернативите включват Inkling-Small с text, image и audio входове и MiMo-V2.5 с native omnimodal възможности, както и Step-3.7-Flash с 256K контекст. Предимството на тази категория е балансът: достатъчно скорост за coding и agentic workflows, без да се влиза в още по-скъп setup.
Три или четири устройства
При три Spark-а авторката препоръчва community GLM-5.2 Vision derivative — или комбинация, при която DeepSeek работи на две устройства, а третото поема изображения, ComfyUI и по-малки vision модели. Важно: публикуваните 348K контекст и 25 tok/s идват от различни runtime профили и не трябва да се четат като една едновременно измерена конфигурация.
При четири устройства GLM 5.2 NVFP4 може да използва целия cluster. Другият вариант е да разделим хардуера на две независими двойки и да изпълняваме различни workloads паралелно.
Скоростите не са обещание
Всички числа тук са practically-tested резултати на Mia, не гарантирани vendor стойности. Различни драйвери, quantization, context length, batch size и inference runtime могат да дадат съвсем друга скорост.
Но общата посока е ясна. Компактният локален хардуер вече може да обслужва модели, които допреди година свързвахме само с облачни центрове за данни. Цената на няколко DGX Spark устройства остава сериозна — но за екипи с чувствителни данни или постоянен inference локалният вариант започва да има реален смисъл.


