Lokal AI-server för företag: vad krävs egentligen?
En användbar lokal AI-server börjar på ett 24 GB GPU och 64 GB RAM, från ungefär 5 000 euro. Hårdvara, GPU-generationer, mjukvara, verkliga kostnader och när molnet vinner.
En lokal AI-server som ett team faktiskt fortsätter använda börjar på ett GPU med 24 GB VRAM, 64 GB systemminne och en snabb NVMe-disk. Det räcker för att köra en 27B- till 32B-modell med god kvalitet för ett fåtal samtidiga användare. Budgetera från ungefär 5 000 euro för en enklare maskin och 12 000 till 20 000 för något som en hel avdelning kan luta sig mot. Hårdvaran är den enkla delen. Det som avgör om projektet lyckas är att välja rätt GPU-generation av rätt anledningar, mjukvaran runt modellen, en ärlig kalkyl mot molnalternativ och att någon håller igång det hela. Den här guiden täcker allt detta.
Vad avgör egentligen hårdvaruvalet?
Ett enda tal styr allt: VRAM, minnet på grafikkortet. Modellvikterna måste få plats i det, tillsammans med kontextfönstret för varje aktiv konversation. Systemminne, processor och disk spelar mycket mindre roll än de flesta tror.
En tumregel för 4-bitars kvantiserade modeller, det format nästan alla kör i produktion:
| VRAM | Modellstorlek som får plats | Hur det känns |
|---|---|---|
| 8 GB | upp till ~8B | Användbart för enkel sammanfattning och klassificering. Märkbart svagare än ChatGPT. |
| 16 GB | upp till ~14B | Dugligt för intern Q&A och dokumentsökning. |
| 24 GB | upp till ~32B | Den söta punkten. Här börjar lokala modeller kännas genuint bra. |
| 32 GB | ~32B med långt kontextfönster | Utrymme för tunga dokument, fortfarande ett kort. |
| 48 GB (2x24) | ~32B bekvämt, eller 70B i 4-bit | Bekvämt för ett team med flera användare samtidigt. |
| 96 GB+ | 70B och uppåt med marginal | Avdelningsskala, eller tungt kodarbete. |
Om en modell inte får plats i VRAM kollapsar prestandan oavsett hur snabbt kortet är. Det enda faktum driver varje inköpsbeslut nedan: dimensionera efter kapacitet först, välj sedan generation.
Behöver vi Blackwell, den senaste GPU-generationen?
Värt att ta på allvar, eftersom svaret avgör både budget och livslängd. Tre generationer spelar roll under 2026:
Ampere (RTX 3090, 2020). Sex år gammalt och fortfarande vanligt i den lokala AI-communityn, eftersom begagnade kort ger 24 GB för 600 till 1 000 euro. Nackdelen: de säljs i befintligt skick utan garanti, de drar mer ström per token än allt nyare, och kiseln föregår de lågprecisionsformat som modern inferens rör sig mot.
Ada (RTX 4090, 2022). Samma tak på 24 GB, 30 till 50 procent snabbare, till två till tre gånger priset av ett begagnat Ampere-kort. Det besvärliga mellanbarnet.
Blackwell (RTX 5090 och det professionella RTX 6000-sortimentet, 2025). 32 GB på konsumentflaggskeppet och upp till 96 GB på ett enda professionellt kort, nästan dubbelt så hög minnesbandbredd som Ampere, inbyggt stöd för FP8 och FP4, och ungefär 2 till 2,5 gånger inferenshastigheten kort för kort.
För ett hobbyprojekt är andrahandsmarknaden svårslagen: två begagnade 3090:or ger 48 GB för mindre än ett nytt flaggskepp, och entusiaster pressar fram anmärkningsvärda resultat ur dem. Om ni är ett tekniskt team som gärna validerar befintlig hårdvara och accepterar värmen är det en fullt legitim väg, och det låtsas vi inte om annat.
För en maskin ett företag är beroende av ser kalkylen annorlunda ut, och det handlar föga om keynote-benchmarks. Tre saker dominerar över en tre- till femårshorisont. Garanti och tillgång: en produktionsmaskin behöver delar med support och utbytesmöjlighet, och begagnade kort är ett lotteri. Effektivitet: inferenskostnad är i allt högre grad en elräkning, och tokens per watt förbättrades markant mellan generationerna. Det kort som är billigare att köpa är det dyrare att driva, varje timme det är igång. Utvecklingsriktning: öppna modeller levereras i allt högre grad i lågprecisionsformat som Blackwell kör nativt och som äldre kislar bara emulerar. Att köpa sexårig arkitektur med fem års avskrivning innebär att man avvecklar elvaårig arkitektur.
Så det ärliga omdömet: hobbyister bör köpa begagnat Ampere och njuta av det. Ett företag som driftsätter AI man avser att förlita sig på bör specificera aktuell generations kislar, dimensionerade efter VRAM, och se prisdifferensen för vad den är: kostnaden för garanti, effektivitet och att hålla jämna steg med vart modellerna är på väg.
Vad gäller AMD, Intel och Apple?
Värt ett ärligt stycke vardera. AMDs 24 GB-kort är attraktivt prissatta, och ROCm nådde praktisk paritet med CUDA på Linux i början av 2026, men verktygen och community-svaren utgår fortfarande från NVIDIA, vilket spelar roll den dag något går fel. Intels Arc Pro-linje ger billigt VRAM med ett ungt mjukvaruekosystem. Apples unified memory är remarkabelt för en person, en maxad laptop rymmer förvånansvärt stora modeller, men minnesbandbredden begränsar flertalet användares genomströmning, och en laptop är inte en server. För en företagsmaskin som ska betjäna ett team under 2026 är NVIDIA fortfarande det tråkiga, korrekta svaret.
Vad är kvantisering, och varför använder alla det?
Modeller tränas i hög precision men kan köras i lägre precision, vilket krymper dem dramatiskt. En 32B-modell som behöver över 60 GB i full precision får plats på under 20 GB i 4-bit, med en kvalitetsförsämring som knappt märks i vardagsbruk. Det här är inget kompromissknep, det är så lokal AI i produktion fungerar, och de nyaste GPU:erna accelererar nu dessa format i hårdvara. Den praktiska regeln: utgå från 4-bit, och testa kvaliteten på era egna dokument och ert eget språk innan ni bestämmer er. Benchmarks är skrivna på engelska; era fakturor är det inte.
Vilka modeller ska vi planera för?
Landskapet med öppna vikter har rört sig snabbt, och i en positiv riktning. I 24 till 32B-klassen hanterar modeller som Qwen3.6 27B och Gemma 4 31B allmänt assistentarbete, sammanfattning och dokument-Q&A på en nivå som hade krävt ett datacenter för två år sedan. Båda levereras under tillåtande licenser, vilket spelar roll om ni planerar att bygga vidare.
Två praktiska noter. Licenser skiljer sig mer än folk kontrollerar: Apache 2.0 och MIT är de rena, medan vissa populära modellfamiljer levereras under skräddarsydda community-licenser med användningsgränser. Låt någon läsa licensen innan ni standardiserar på en modell. Och för dokumentsökning spelar hämtningskvaliteten större roll än modellstorleken. Bra chunking och en solid embeddingmodell med en 27B-modell slår en 70B-modell med slarvig hämtning, varje gång.
Hur ser mjukvarustacken ut?
Detta är vad köpare underskattar mest. Ett grafikkort och en modellfil är ingen produkt. En fungerande uppsättning behöver fem lager:
En inferensmotor som betjänar modellen effektivt. vLLM är standarden för flerAnvändarbetjäning eftersom den batchhanterar parallella förfrågningar korrekt. Ollama och llama.cpp är utmärkta för enstaka användare men ansträngs under teambelastning.
Ett API-lager, vanligtvis OpenAI-kompatibelt, så att interna verktyg kan kommunicera med er server på samma sätt som med valfri AI-leverantör.
Ett chattgränssnitt som teamet faktiskt vill använda. Om det är fulare eller långsammare än fliken de redan känner till går de tillbaka till den, och era data går med dem.
Hämtning, för dokumentarbete. En embeddingmodell, ett vektorlager, chunkningslogik och källhänvisningar i svaren. Det är här de flesta gör-det-själv-projekt stannar.
Åtkomstkontroll och loggning. Vem får använda det, vilka avdelningar ser vilka dokument, och vad loggas för revision.
Inget av detta är exotiskt, allt är öppen källkod, och att koppla ihop det till något ett icke-tekniskt team älskar är ett verkligt projekt. Planera veckor av ingenjörsarbete, inte dagar, om ni bygger det själva.
Hur många kan en maskin betjäna?
Fler än de flesta förväntar sig, eftersom användning sker i spurtar. Folk läser en minut efter varje svar de får.
Med ett 24 GB-kort och en 27B-modell fungerar ett team på 5 till 15 sporadiska användare i allmänhet bra. Två kort och ni är bekväma med 20 till 50 för chatt och dokumentarbete: ett 30-personers företag där tio frågar under en given timme värmer knappt kön. Tung kontinuerlig användning, kodassistenter för ett helt devteam eller automatiserade pipelines dygnet runt, förändrar kalkylen helt: sådana arbetsbelastningar skalas efter tokens per sekund, inte efter antal användare, och det är precis där aktuella generationers bandbredd betalar sig.
Två saker avgör upplevelsen. Korrekt batchhantering i betjäningslagret, och att hålla modellen resident i VRAM hela tiden. En server som laddar modellen vid varje förfrågan känns trasig. En som håller den varm känns omedelbar.
Vad kostar det att driva?
Tre tal att planera efter.
Hårdvara. Från ungefär 5 000 euro för en enkortsmaskin, 12 000 till 20 000 för en dubbel-GPU-arbetshäst med aktuella generations kort. Kapitalutgift, avskriven över tre till fem år, inte en prenumeration.
El. En dubbel-GPU-maskin drar runt 700 till 900 W under belastning, betydligt mindre i viloläge, och nyare generationer levererar meningsfullt fler tokens per watt. Med svenska kommersiella elpriser landar det ungefär i intervallet 400 till 900 euro per år beroende på användning.
Drift. Den post som folk oftast glömmer. Patchning, modelluppdateringar, övervakning och felsökning. Budgetera några timmars kompetent tid per månad, eller köp det som en tjänst. Att ignorera det är hur bra hårdvara förvandlas till en dyr hylla.
Är lokalt verkligen billigare än molnet?
Ibland. Var skeptisk mot den som säger alltid.
Jämför mot rätt sak. Om alternativet är prenumerationer per användare gynnar kalkylen att äga förvånansvärt snabbt: enterprise AI-planer kostar typiskt 40 till 60 euro per säte per månad, så 30 säten blir 43 000 till 65 000 euro över tre år, mot ungefär 20 000 till 30 000 allt inkluderat för en dubbel-GPU-maskin under samma period. Om alternativet är råa API-anrop vinner API:et ofta på rena tokenkostnader vid låg och medelhög volym, och break-even nås först vid tungt hämtningsarbete, kodassistenter eller pipelines dygnet runt.
| Scenario över 3 år | Moln, typiskt intervall | Lokalt, allt inkluderat | Omdöme |
|---|---|---|---|
| 5 personer, sporadisk chatt | API: under 2 000 | 8 000 till 12 000 | Molnet vinner på kostnad. Lokalt är ett integritetsbeslut. |
| 30 personer, chatt och dokumentsökning | Säten: 43 000 till 65 000 | 20 000 till 30 000 | Att äga vinner, och datan stannar hemma. |
| Devteam med kodassistent, tung daglig användning | API: 30 000 till 90 000+ | 25 000 till 40 000 | Att äga vinner med god marginal. |
Intervallen är medvetet breda; stoppa in era egna siffror. En sak tabellen inte kan visa: med ett enterprise-molnkontrakt lämnar datan fortfarande ert nätverk, behålls typiskt för missbruksövervakning och befinner sig under utländsk jurisdiktion. En klausul om att data inte används för träning ger den inte tillbaka. Den ärliga sammanfattningen: under en viss intensitet väljer ni lokalt för kontroll, inte för besparing. Ovanför den får ni bådadera.
Hur håller vi det säkert?
En lokal server tar bort tredjepartsrisken och ger er den operativa. Grunderna är inte valfria: enkel inloggning mot er befintliga identitetsleverantör, så att åtkomst följer anställning. Nätverkssegmentering, AI-servern behöver inte nå internet för att ge svar, och i air-gappade upplägg gör den det aldrig. Dokumentbehörigheter som speglar era filbehörigheter, så att hämtning inte kan läcka lönefilen till alla. Loggning som tillfredsställer era revisorer utan att lagra varje prompt för evigt. Krypterade diskar och säkerhetskopior av konfiguration och index, modellerna i sig är utbytbara.
Och placering: ett låst, ventilerat rum med stabil elförsörjning och kabelnätverk. Moderna GPU:er under belastning är högljudda, varma och stöldbegärliga. Fysisk åtkomst är åtkomst.
För helt air-gappade miljöer, bestäm i förväg hur uppdateringar tas in. Det måste vara en designad process med signerade, verifierade paket, inte ett slumpmässigt USB-minne som någon bär in.
När är en lokal server fel val?
Ofta. Om era data juridiskt och kommersiellt kan behandlas av en molnleverantör, och volymen är blygsam, är molnet enklare och oftast billigare: vi har skrivit en separat guide om när ChatGPT fungerar under GDPR och vilka avtal det kräver. Om ni behöver den absoluta frontlinjen av förmåga på de svåraste resonemangsuppgifterna är de största proprietära modellerna fortfarande före vad som ryms i en enda maskin. Och om ingen i organisationen äger driftssidan kommer en lokal server att tyst försämras tills folk går tillbaka till att klistra in text i en webbläsare.
Lokal AI lönar sig när data inte får lämna byggnaden, när volymkalkylen ovan tippar till er fördel, när ni vill sluta följa varje vändning i EU-US-överföringssagan, eller när ni måste kunna bevisa exakt var behandling sker.
Vad är ett vettigt första steg?
Inte en företagsomfattande utrullning. Välj ett användningsfall med uppenbart värde och avgränsad räckvidd: kontraktssökning för juridikteamet, en kodassistent för ett devgäng, intern policy-Q&A för HR. Kör det i fyra till sex veckor på riktigt arbete. Mät om folk återvänder på eget initiativ, det är det enda adoptionsmått som spelar roll. Skala sedan till nästa avdelning med bevis i handen i stället för löften.
Hur vi löser det med Blackbox
Blackbox är en maskin vi specificerar, bygger och levererar till ert kontor, med aktuella generations hårdvara. Tre nivåer, direkt mappade mot nivåerna i den här guiden: Entry med ett Blackwell-GPU på 24 GB VRAM och 64 GB RAM, det enklaste sättet för ett mindre team att börja, och det kör modeller upp till ungefär 30B bekvämt när de kvantiseras. Base, konfigurationen de flesta kunder väljer, med två Blackwell-GPU:er på sammanlagt 48 GB och 128 GB RAM, byggd för större modeller och verklig organisationsomfattande användning. Enterprise på serverklassad rackhårdvara med konfigurerbart VRAM, en Threadripper-plattform och 256 GB RAM och uppåt, för driftsättningar utan praktiskt tak.
Hur vi löser det med Blackbox
Blackbox är en maskin vi specificerar, bygger och levererar till ert kontor, med aktuella generations hårdvara. Tre nivåer, direkt mappade mot nivåerna i den här guiden: Entry med ett Blackwell-GPU på 24 GB VRAM och 64 GB RAM, det enklaste sättet för ett mindre team att börja, och det kör modeller upp till ungefär 30B bekvämt när de kvantiseras. Base, konfigurationen de flesta kunder väljer, med två Blackwell-GPU:er på sammanlagt 48 GB och 128 GB RAM, byggd för större modeller och verklig organisationsomfattande användning. Enterprise på serverklassad rackhårdvara med konfigurerbart VRAM, en Threadripper-plattform och 256 GB RAM och uppåt, för driftsättningar utan praktiskt tak.
Mjukvarustacken från tidigare i den här guiden levereras färdigmonterad. Varje Blackbox kör KairosOS, vårt mjukvarulager, med Kairos-sviten ovanpå:
Kairos Chat är den dagliga AI-arbetsytan: skriv om, forska, sammanfatta och generera, i en miljö ni kontrollerar helt.
Kairos Index svarar på frågor om era egna dokument. Varje svar bär hänvisningar tillbaka till källan, och systemet vägrar svara när belägg saknas i ert material.
Kairos Codex, nu i pilot, för AI-assisterad kodning in i den IDE era utvecklare redan använder, med källkod som aldrig lämnar nätverket. Kairos Agents kommer härnäst.
Modeller betjänas via vLLM och hålls varma i VRAM, så svar startar omedelbart. Åtkomstkontroll, loggning och dokumentbehörigheter är inbyggda, och air-gappade maskiner tar emot uppdateringar som kryptografiskt signerade paket. Vi driver också våra egna produkter på exakt den här infrastrukturen, så vi känner av samma driftssmärtor ni skulle göra, innan ni gör det.
Typisk tid från beställning till ett driftsatt AI-lager är fyra till åtta veckor. Läs mer om mjukvaran på kairos.athlas.io eller hårdvaran på athlas.io/blackbox. Vi tar också gärna med en Blackbox till ert kontor för exakt den typ av pilot som beskrivs ovan, med era egna dokument. Boka en demo.
Typisk tid från beställning till ett driftsatt AI-lager är fyra till åtta veckor. Ni kan läsa mer om mjukvaran på kairos.athlas.io eller hårdvaran på athlas.io/blackbox. Vi tar också gärna med en Blackbox till ert kontor för exakt den typ av pilot som beskrivs ovan, med era egna dokument. Boka en demo.
Snabbchecklista innan ni köper
- Definiera arbetsbelastningen först: hur många personer, som gör vad, hur ofta.
- Kör treårskalkylen mot både säten och API för er volym.
- Dimensionera efter VRAM först: köp den kapacitet arbetet kräver i dag.
- För en produktionsmaskin, föredra aktuella generations kislar: garanti, tokens per watt och inbyggt stöd för vart modellformat är på väg.
- Utgå från 4-bitars kvantisering och verifiera kvaliteten på era egna data och ert eget språk.
- Planera hela stacken: betjäning, gränssnitt, hämtning, åtkomstkontroll. Inte bara GPU:n.
- Ordna placering, el, nätverkssegmentering och uppdateringsprocess tidigt.
- Namnge den person som ansvarar för drift, eller köp det som en del av affären.
- Börja med ett användningsfall i fyra till sex veckor, skala sedan på bevis.
Källor
Moln vs egen AI över 3 år
Räkna på era siffror med samma antaganden som i guiden. Gratis, direkt på sidan.
Öppna kalkylen →AI-pilot. 4 veckor. Fast pris.
Ett avgränsat användningsfall på er data, levererat på fyra veckor.
Boka scopingsamtal →Fortsätt läsa
Vill du se det här live?
Femton minuter, ert användningsfall, ett konkret nästa steg. Vi visar lokal AI i drift på hårdvara ni kan äga.