En Mac Mini med tillräckligt mycket minne kan köra flera lokala språkmodeller samtidigt, dygnet runt, på mindre ström än en glödlampa i tomgång. Det är minnesmängden som avgör vad du kan köra, inte grafikkortets råstyrka. Och just där har Apples unified memory en fördel som är svår att matcha i en vanlig hemmabyggd dator utan att lägga rejält med pengar på grafikkort.
För dig som vill köra AI-agenter hemma, alltså modeller som läser din mejl, sorterar filer eller svarar på frågor om dina egna dokument, är det här värt att förstå innan du börjar handla komponenter. Har du redan bestämt dig för att bygga något större kan vår genomgång av bästa datorn för AI vara ett bra komplement.
Minnesmängden avgör vilken modell du kan köra
En språkmodell måste ligga i minnet för att kunna svara snabbt. Ligger den på disken blir det outhärdligt långsamt. Det betyder att frågan ”vilken modell kan jag köra?” i praktiken är samma sak som ”hur mycket minne har jag att lägga modellen i?”.
I en vanlig PC är det grafikkortets VRAM som gäller. Ett grafikkort med 12 GB VRAM kan köra en modell som får plats i 12 GB, punkt. Systemets 64 GB RAM hjälper inte, eftersom trafiken över PCIe-bussen dödar hastigheten. Vill du köra större modeller får du köpa ett dyrare kort och de riktigt minnesstinna korten är inte konsumentprodukter.
Apple Silicon fungerar annorlunda. Processor, grafikdel och neural engine delar på samma minnespool. Har maskinen 32 GB unified memory kan grafikdelen använda en stor del av dem till modellvikter. Ingen kopiering fram och tillbaka, ingen separat VRAM-budget.
Det här är också anledningen till att en Mac Mini kan kännas underligt kapabel för sitt format. Den vinner inte på råstyrka. Den vinner på att den slipper flaskhalsen.
Modellstorlek avgör minneskravet, från 3 till 70 miljarder parametrar
Tabellen nedan visar ungefär vad du behöver för att köra en modell kvantiserad till 4 bitar, vilket är standard för lokal körning. Lägg till några gigabyte för operativsystem och kontextfönster.
| Modellstorlek | Minne för modellen | Fungerar på Mac Mini med | Typisk användning |
|---|---|---|---|
| 3-4 miljarder parametrar | ca 2-3 GB | 16 GB | Snabba textklassificeringar, enkel sammanfattning |
| 7-8 miljarder parametrar | ca 4-5 GB | 16 GB | Allmän chatt, kodhjälp, agent-loopar |
| 13-14 miljarder parametrar | ca 8-9 GB | 16 GB (knappt), 24 GB bekvämt | Bättre resonemang, längre dokument |
| 30-34 miljarder parametrar | ca 18-20 GB | 32 GB | Kvalificerad kodgenerering, analys |
| 70 miljarder parametrar | ca 40-42 GB | 64 GB | Nära molnkvalitet på enkla uppgifter |
| Flera modeller parallellt | summan av ovan | 32-64 GB | Agent-system med specialiserade modeller |
Notera sista raden. Ett agent-system består sällan av en enda modell. Du kan ha en liten snabb modell som avgör vad frågan handlar om, en mellanstor som gör själva jobbet och en embedding-modell som söker i dina dokument. Alla tre ska ligga laddade samtidigt om du vill slippa väntetid. Då blir 32 GB minimum och 64 GB behagligt.
Effektförbrukningen är det egentliga argumentet
En agentmaskin ska stå på. Hela tiden. Den ska vakna när något händer i din inkorg, indexera nya filer på natten och svara när du frågar den något klockan halv sju på morgonen.
En Mac Mini i vila drar några få watt. Under belastning landar den i storleksordningen 20 till 40 watt beroende på chip och last. En hemmabyggd rigg med ett kraftigare grafikkort ligger snarare på 60 till 100 watt i tomgång och betydligt mer när modellen jobbar.
Räkna själv med ditt elpris. Skillnaden mellan 15 watt och 80 watt dygnet runt är ungefär 570 kWh per år. Det är inga astronomiska pengar men det är en återkommande kostnad som äter upp prisskillnaden mot en dyrare maskin över några år. Lägg till att den tysta maskinen faktiskt går att ha i vardagsrummet utan att låta som en dammsugare.
Att just AI-agenter blir en tung last för datacenter är något branschen redan märkt av och samma logik gäller i mindre skala hemma. Det är kontinuerlig drift, inte enstaka toppar, som kostar.
När en GPU-rigg fortfarande är rätt val
Mac Mini är inte svaret på allt. Ska du finjustera egna modeller, träna något från grunden eller köra bildgenerering i volym är ett Nvidia-kort med CUDA fortfarande överlägset. Ekosystemet av verktyg är byggt för CUDA först, Metal i andra hand.
Samma sak gäller om du behöver hög genomströmning, alltså många samtidiga förfrågningar. Apple Silicon har hyfsad minnesbandbredd men de dedikerade grafikkorten har mer. Vid batch-körning märks det.
För en enskild användare som ställer en fråga i taget spelar det mindre roll. Du hinner ändå inte läsa svaret snabbare än modellen skriver det.
Köp minne, inte processorkraft
Det är det enskilt viktigaste rådet. Skillnaden mellan grundchip och det uppgraderade chipet påverkar hur snabbt svaren kommer men minnesmängden avgör om modellen över huvud taget kan köras. En långsam maskin som klarar uppgiften slår en snabb maskin som får slut på minne.
Minnet går inte att uppgradera i efterhand. Apple löder fast det. Det du köper på dag ett har du kvar tills du byter maskin, så ta hellre ett steg upp än ett steg ner.
Lagring är mindre kritiskt. Modellfiler tar plats, en handfull större modeller landar på 100 till 200 GB men extern SSD över Thunderbolt fungerar utmärkt för arkivet. Ha bara den modell du använder dagligen på interndisken.
Vill du jämföra med andra små maskiner har vi en genomgång av mini-PC som format och för själva inköpet finns våra tips på var du handlar hårdvara online.
Lokalt betyder inte automatiskt säkert
Poängen med att köra agenter hemma är ofta integritet. Dina mejl, dokument och anteckningar lämnar aldrig huset. Det är ett reellt argument, särskilt om du hanterar känsliga uppgifter.
Men en agent som får läsa dina filer och skicka nätverkstrafik är en attackyta oavsett var den står. Har du öppnat upp maskinen mot internet för att kunna nå den från mobilen har du byggt en dörr in i ditt hemnätverk. Kör den bakom VPN eller inte alls utifrån.
Riskerna med autonoma agenter som får agera på egen hand har vi gått igenom separat och de gäller i högsta grad även hemmaservern.
FAQ
Räcker 16 GB för att komma igång?
Ja, för att testa. Du kan köra modeller upp till ungefär 13 miljarder parametrar och det duger för sammanfattning, enklare kodhjälp och att lära dig hur verktygen fungerar. Men du kommer att stöta i taket ganska snart om du bygger något med flera modeller.
Hur mycket långsammare är det än ChatGPT?
På en modell i 7-8 miljarder-klassen får du typiskt några tiotals tokens per sekund på en Mac Mini, vilket är snabbare än du läser. Större modeller blir märkbart trögare. Kvaliteten på svaren är den större skillnaden, inte hastigheten.
Vilken programvara behöver jag?
Ollama och LM Studio är de vanligaste startpunkterna och båda kör Apple Silicon nativt. Ollama passar bäst om du vill köra maskinen som en server som andra enheter i hemmet pratar med.
Kan jag använda en gammal Intel-Mac istället?
Nej, inte på ett meningsfullt sätt. Intel-Macarna saknar unified memory och har svag grafikdel. Modeller körs på processorn och blir för långsamma för praktiskt bruk.
Den intressanta utvecklingen framåt är att modellerna krymper snabbare än hårdvaran växer. En modell på 8 miljarder parametrar presterar i dag ungefär som en betydligt större modell gjorde för två år sedan. Köper du en maskin med gott om minne nu blir den sannolikt mer användbar om två år, inte mindre.

