CodeFusion

Test lokalnego LLM

30.07.2026

Na co dzień kodujemy z flagowymi modelami od Anthropic i OpenAI. Pełna zależność od cudzej infrastruktury to jednak realne ryzyko, więc poświęciliśmy tydzień, żeby zmierzyć alternatywę – Qwen3.6-27B lokalnie na Lenovo ThinkStation PGX (NVIDIA GB10, platforma DGX Spark), wypożyczonym dzięki uprzejmości firit.pl (dziękujemy!).

Sprzęt uruchomiliśmy bez problemów, model w zasadzie również, ale do naszego głównego obiegu pracy jeszcze nie dorasta. Nie zatrzymała nas jego jakość, ale raczej przepustowość pojedynczej sesji (ok. 10 tok/s, merge specek w 14 min vs. 1-2 min u Claude, złożone analizy czasami kończące się timeoutem) oraz dojrzałość operacyjna stacku ustabilizowanie backendu trochę potrwało.

Ekonomia tego rozwiązania domyka cały obraz: przy obecnym zużyciu (nie robimy tokenmaxingu 😉) sprzęt zwróciłby się u nas w horyzoncie lat. Zakup stałby się racjonalny dopiero przy mocnym wzroście kosztów planów subskrypcyjnych.

Na razie zostajemy więc przy abonamentach u gigantów z USA oraz z tańszym API jako kanałem zapasowym, a lokalny sprzęt trzymamy jako świadomą opcję – z jasnym warunkiem powrotu oraz do zadań, gdzie liczy się nie cena, ale to, że dane nie opuszczą infrastruktury klienta. To nie zabezpieczenie „na gorsze czasy”, tylko znajomość granic własnej architektury, dzięki której wybór dostawcy pozostaje wyborem, a nie przymusem.

»
strzałka do góry