PC PRO LOKÁLNÍ AI
AI PC – 2× RTX 3060 12 GB · 24 GB VRAM · 64 GB RAM
24 GB VRAM ve dvou kartách: firemní asistent nad dokumenty do 30B parametrů. Data zůstávají u vás.
Rychlé příplatky
Ostatní
Microsoft Office
Prodloužená záruka
Počítač postavený na jednu věc: provozovat velké jazykové modely přímo ve firmě. Dvě grafické karty RTX 3060 dávají dohromady 24 GB paměti, do které se ve 4-bitové kvantizaci vejdou modely do zhruba 30 miliard parametrů — Qwen2.5 14B i 32B, Gemma 3 27B, Mistral Small 24B nebo gpt-oss 20B od OpenAI. Druhá karta zároveň umožní pustit dva modely naráz: třeba asistenta pro tým a druhý, který na pozadí zpracovává dokumenty.
64 GB RAM slouží k odkládání větších modelů a práci s daty, 2 TB NVMe disk WD Black SN850X načte dvacetigigový model za pár sekund. Zdroj 1200 W Gold má rezervu na budoucí výměnu karet za výkonnější. Tři průmyslové ventilátory Noctua udrží teploty i při hodinách nepřetržité zátěže — je to stroj do serverovny nebo technické místnosti, ne pod stůl vedle lidí. Pro kancelář nabízíme tišší variantu chlazení.
Na co se hodí: spouštění hotových modelů (Ollama, LM Studio, vLLM), asistent nad firemními dokumenty (RAG), obsluha více uživatelů souběžně, dotrénování menších modelů metodou LoRA. Na co ne: plný trénink velkých modelů — na ten jsou potřeba karty s 48 GB paměti a rychlé propojení mezi nimi. Druhá karta běží ve slotu PCIe 4.0 x4; při běhu modelů to nevadí, váhy se načtou jednou, pro tensor-parallel trénink by to ale bylo úzké hrdlo. A dvě karty sčítají paměť, ne rychlost jedné odpovědi.
Za příplatek 5 000 Kč vyměníme Ryzen 5 5600 za šestnáctijádrový Ryzen 9 5950X. Vyplatí se, pokud budete paralelně zpracovávat data, obsluhovat více uživatelů nebo dotrénovávat modely; samotné generování odpovědí, které běží na grafikách, nezrychlí.
AI výkon
24 GB
VRAM celkem
2× 12 GB
64 GB
RAM
pro offload a data
2×
grafické karty
RTX 3060 · souběžné modely
Sestava pro modely do ~30 miliard parametrů ve 4-bitové kvantizaci — třída, ve které dnes běží většina firemních asistentů nad dokumenty.
Co na sestavě poběží (4-bit, kontext 8k)
| Model | Paměť | Rychlost |
|---|---|---|
Qwen2.5 14B vyvážený firemní asistent, RAG nad dokumenty | Vejde se10.5 GB | ~26 tok/s |
gpt-oss 20B (OpenAI) otevřený model OpenAI, díky MoE rychlý | Vejde se13 GB | ~83 tok/s |
Mistral Small 3.1 24B evropský model, silný na dokumenty a instrukce | Vejde se15.7 GB | ~16 tok/s |
Gemma 3 27B nejsilnější Gemma, text i obrázky | Vejde se17.1 GB | ~14 tok/s |
Qwen3 30B-A3B (MoE) znalosti velkého modelu, rychlost malého | Vejde se19.1 GB | ~91 tok/s |
Qwen2.5 32B náročnější texty a analýzy | Na hraně21.8 GB | ~12 tok/s |
Llama 3.3 70B vlajková třída, potřebuje 48 GB VRAM | Nevejde se45 GB | — |
Paměť je spočítaná z vah modelu a KV cache. Rychlost je orientační odhad z propustnosti paměti grafiky; naměřené hodnoty ze zahoření doplňujeme.