PC pro lokální AI

Vlastní AI ve firmě. Bez cloudu, bez předplatného, bez úniku dat.

Stavíme počítače, na kterých běží velké jazykové modely přímo u vás — smlouvy, účetnictví ani zdrojový kód neopustí firemní síť. U každé sestavy říkáme, jaký model se do ní vejde a jak rychle odpoví.

Proč lokální AI místo cloudu

Data zůstávají u vás

Model běží na vašem hardwaru. Dotazy ani dokumenty nikam neodcházejí — pro práci pod NDA, s osobními údaji nebo zdravotní dokumentací je to často jediná schůdná cesta.

Jednorázová investice

Cloudová AI se platí za uživatele a měsíc. Vlastní stroj obslouží celý tým bez limitů na počet dotazů a typicky se zaplatí do roka.

Ceny komponent rostou

Paměti i grafické karty zdražují. Sestava koupená dnes je zároveň pojistka proti další vlně — a hardware si drží hodnotu i pro jiné úlohy.

Sestavy pro lokální AI

U AI počítače nerozhoduje FPS, ale paměť grafických karet. Proto u každé sestavy uvádíme celkovou VRAM a přehled modelů, které na ní poběží.

Vejde se váš model?

Vyberte model, kvantizaci a délku kontextu. Potřebnou paměť počítáme z vah modelu a KV cache — přesně, ne odhadem. Odhadem je jen rychlost.

Kvantizace
Délka kontextu

Vejde se s rezervou

Potřebná paměť10,5 GB
váhy: 8.9 GB · kontext: 1.6 GBk dispozici: 21.9 GB

Z celkových 24 GB VRAM na 2 kartách po odečtení režie ovladačů a rozdělení mezi karty.

Odhad rychlosti generování

~26 tokenů za sekundu (≈ slov za sekundu)

Orientační odhad z propustnosti paměti grafiky. Skutečná rychlost závisí na softwaru a nastavení — naměřené hodnoty u sestav doplňujeme. Dvě karty sčítají paměť, ne rychlost — vrstvy modelu běží po sobě.

Vejde se: model běží s rezervou i na delší dokumenty

! Na hraně: běží, ale bez rezervy na delší kontext nebo druhý model

Nevejde se: potřebuje víc VRAM, nebo běží pomalu z RAM

Kvantizace zmenšuje model tak, aby se vešel do paměti: 4-bit (Q4) ztrácí jen minimum kvality a je standardem pro lokální nasazení, 8-bit je kompromis, 16-bit je originál bez komprese.

Pro koho to stavíme

Pro firmy, které chtějí AI používat na vlastních datech a nemohou nebo nechtějí je posílat do cloudu.

  • Advokátní kanceláře a notáři — práce se smlouvami a spisy pod mlčenlivostí
  • Účetní a daňové firmy — faktury, výpisy a osobní údaje klientů
  • Ordinace a zdravotnická zařízení — dokumentace, kterou nelze sdílet
  • Vývojářské týmy — asistent ke kódu bez odesílání zdrojáků třetí straně
  • E-shopy a marketing — popisy produktů a texty ve velkém, bez plateb za token
  • Výroba a servis — vyhledávání v manuálech a interní znalostní báze

Na co se hodí a na co ne

  • ✓ Spouštění hotových modelů (inference), asistent nad firemními dokumenty, více uživatelů nebo modelů souběžně, dotrénování menších modelů metodou LoRA.
  • ✗ Plný trénink velkých modelů — na to je potřeba 48 GB+ VRAM na kartu a rychlé propojení karet. Poradíme, kdy dává smysl kombinace lokální stroj + cloud.
  • Dvě karty znamenají větší model a víc souběžných uživatelů, ne dvojnásobnou rychlost jedné odpovědi. Říkáme to dopředu, protože se to jinak snadno přeprodává.

Jak to probíhá

01

Poptávka a návrh

Popíšete, co chcete s AI dělat a kolik lidí ji bude používat. Doporučíme sestavu — nebo upravíme konfiguraci, aby seděla na váš model.

02

Stavba a test

Sestavu postavíme, zahoříme a otestujeme přímo s modely, které budete používat. Rychlost měříme na konkrétním kusu.

03

Předání a první spuštění

Na přání připravíme prostředí (ovladače, Ollama nebo LM Studio, webové rozhraní), aby první model běžel hned po zapnutí. Faktura s DPH, záruka 24 měsíců.

Slovníček — co znamenají čísla u AI sestav

VRAM (paměť grafické karty)
Jediné číslo, které rozhoduje, jestli se model spustí. Model musí být celý v paměti grafiky; co se nevejde, běží z RAM řádově pomaleji. Dvě karty svou paměť sčítají — 2× 12 GB dá 24 GB.
Kvantizace (Q4, Q8)
Zmenšení modelu, aby se do paměti vešel. 4-bitová (Q4) je standard pro lokální provoz — ztrácí minimum kvality a proti originálu zmenší model více než třikrát. Model o 14 miliardách parametrů tak zabere zhruba 9 GB místo 28 GB.
Kontext
Kolik textu model udrží „v hlavě“ najednou. 8k tokenů je zhruba 25 normostran, 32k asi 100 stran. Delší kontext zabere víc paměti, protože se k modelu přičítá KV cache.
Tokeny za sekundu
Rychlost odpovědi. Token je zhruba slabika až slovo; nad 15 tokenů/s čte odpověď rychleji, než stíháte číst. Limit dává propustnost paměti grafiky, ne výkon procesoru.
RAG (odpovídání nad vlastními dokumenty)
Postup, kdy model odpovídá na základě vašich smluv, manuálů nebo směrnic. Dokumenty se zaindexují a modelu se k dotazu podstrčí relevantní pasáže — nemusí se kvůli tomu přeučovat.
Ollama a LM Studio
Programy, které model spustí a nabídnou ho jako chat nebo API pro vaše aplikace. Běží offline, bez účtu a bez předplatného. Na přání je na stroj nachystáme.

Časté otázky k PC pro lokální AI

Jaký model na sestavě poběží?
Rozhoduje celková VRAM. S 24 GB zvládnete ve 4-bitové kvantizaci modely do zhruba 30 miliard parametrů (Qwen2.5 14B, Gemma 3 27B, Mistral Small 24B). Na třídu 70B je potřeba 48 GB. Přesně to spočítá kalkulačka výše.
Proč dvě grafické karty, a ne jedna větší?
Dvě použité karty se stejnou celkovou pamětí vyjdou často výrazně levněji než jedna nová velká. Sčítají paměť a obslouží dva modely nebo více uživatelů naráz. Nezdvojnásobí ale rychlost jedné odpovědi.
Jak rychle model odpovídá?
U kvantizovaného modelu do 14B počítejte s desítkami tokenů za sekundu — rychleji, než čtete. U 30B modelů rozdělených mezi dvě karty s jednotkami až nižšími desítkami. Přesné hodnoty měříme na každé sestavě.
Zůstanou data opravdu u nás?
Ano. Model běží na vašem hardwaru, dotazy ani dokumenty neopouštějí síť. Nástroje jako Ollama nebo LM Studio pracují úplně offline, bez účtu a bez předplatného.
Bude to hlučné a kolik to bere elektřiny?
Pod zátěží jde o výkonný stroj — počítejte s odběrem v řádu stovek wattů při generování a s chlazením, které je slyšet. Nabízíme tišší variantu pro kancelář i výkonnější do serverovny; do poptávky napište, kde stroj bude stát.
Můžu sestavu později rozšířit?
Ano — u každé sestavy uvádíme, kolik má rezervu ve zdroji a slotech. Typický upgrade je výměna karet za model s větší pamětí nebo silnější procesor pro paralelní zpracování dat.

Poptávka PC pro lokální AI

Napište, co chcete s AI dělat, kolik lidí ji bude používat a kde stroj bude stát. Ozveme se do jednoho pracovního dne s doporučením.

Napište nám
Made with AI in Macaly