Най-подходящите AI модели за NVIDIA DGX Spark през август 2026

Практически тестове показват какви големи AI модели могат да работят локално върху един до четири NVIDIA DGX Spark устройства.

Най-подходящите AI модели за NVIDIA DGX Spark през август 2026

Локален AI с милион токена контекст вече не означава задължително огромна сървърна зала. Понякога означава една малка кутия на бюрото — стига тази кутия да е NVIDIA DGX Spark.

Mia AI Lab публикува практичен списък с модели, които е тествала върху конфигурации от едно до четири DGX Spark устройства. Това не е официална класация на NVIDIA, а работеща отправна точка за хората, които искат силен локален модел без облачен API.

Един DGX Spark

Основната препоръка е DeepSeek V4 Flash с контекст до 1 милион токена и измерена скорост около 26 tok/s. Това не е светкавично бързо, но е впечатляващо за модел от този клас върху едно компактно устройство.

В списъка присъстват и Qwen 3.6 35B NVFP4 с 256K контекст и около 81 tok/s, както и 27B вариант с около 33 tok/s. Тук quantization-ът е ключов — NVFP4 позволява голям модел да се побере в наличната памет, но точността и скоростта зависят от runtime-а.

Авторката споменава и бъдещ Qwen 3.8 27B, който според нея може да промени препоръката. Този модел обаче е описан като предстоящ, а не като вече наличен избор.

Два Spark-а — практичният sweet spot

При cluster от две устройства DeepSeek V4 Flash 0731 достига около 82 tok/s в тестовете на Mia. Това е конфигурацията, която тя препоръчва най-силно.

Алтернативите включват Inkling-Small с text, image и audio входове и MiMo-V2.5 с native omnimodal възможности, както и Step-3.7-Flash с 256K контекст. Предимството на тази категория е балансът: достатъчно скорост за coding и agentic workflows, без да се влиза в още по-скъп setup.

Три или четири устройства

При три Spark-а авторката препоръчва community GLM-5.2 Vision derivative — или комбинация, при която DeepSeek работи на две устройства, а третото поема изображения, ComfyUI и по-малки vision модели. Важно: публикуваните 348K контекст и 25 tok/s идват от различни runtime профили и не трябва да се четат като една едновременно измерена конфигурация.

При четири устройства GLM 5.2 NVFP4 може да използва целия cluster. Другият вариант е да разделим хардуера на две независими двойки и да изпълняваме различни workloads паралелно.

Скоростите не са обещание

Всички числа тук са practically-tested резултати на Mia, не гарантирани vendor стойности. Различни драйвери, quantization, context length, batch size и inference runtime могат да дадат съвсем друга скорост.

Но общата посока е ясна. Компактният локален хардуер вече може да обслужва модели, които допреди година свързвахме само с облачни центрове за данни. Цената на няколко DGX Spark устройства остава сериозна — но за екипи с чувствителни данни или постоянен inference локалният вариант започва да има реален смисъл.

Сподели:👤🐦💼