Hardware &
Qwen Modellerne
Minimumskravene for at køre Qwen2.5-Coder-7B og Qwen2.5-14B med Intel GPU og IPEX er en 11. generations Intel Core-processor med Iris Xe-grafik, mindst 16 GB RAM på Linux (20-24 GB på Windows 11) samt 128-256 GB SSD-lager. Her er de konkrete krav specificeret for begge modeller samt begrundelsen for konfigurationen.
CPU & Intel GPU
IPEX (Intel Extension for PyTorch) og IPEX-LLM udnytter Intels XPU/oneAPI Level-Zero runtime:
- Minimum CPU: Intel Core 11. gen (Tiger Lake) eller nyere. Ældre understøtter ikke OneAPI/Level-Zero.
- Minimum GPU: Intel Iris Xe (96 EUs) eller Intel Arc Graphics.
SSD Lagerplads
- Model-vægte: 7B fylder 5-8 GB. 14B fylder 9-15 GB.
- Software-stack: Docker, OneAPI, drivere og IPEX fylder 20–30 GB.
- Minimum: 128 GB (Linux dedikeret) eller 256 GB (Windows 11).
System RAM (Shared Memory)
Et integreret Intel-grafikkort trækker på system-RAM. Kravene afhænger af styresystem og modelvægt:
Linux: 12-16 GB RAM (OS bruger 1-2 GB).
Win 11: 16 GB RAM (OS bruger 4-6 GB).
Linux: 16 GB (Minimum, snæver kontekst).
Win 11: 24 GB RAM (16 GB vil give OOM-fejl).
Hvorfor Core i9, 32 GB RAM og 1 TB SSD er en god idé
-
Intel Core i9 Mobile (H/HX-serien)
Hurtig token-generering ved "offload": Hvis en stor 14B-prompt overstiger iGPU'ens rammer, skubbes beregninger over på CPU'en. i9-processoren har de højeste clock-frekvenser, hvilket minimerer ventetiden. H/HX-udgaverne har maksimale GPU-frekvenser og store L3-caches.
-
32 GB RAM (Dual-Channel)
Qwen2.5 understøtter op til 128.000 tokens. Jo længere kontekst, desto mere vokser KV-Cachen. Med 32 GB kan du tildele 10–12 GB til GPU'en, have plads til konteksten og stadig lade OS køre uden swapping. Dual-channel fordobler desuden hukommelsesbåndbredden.
-
1 TB NVMe SSD
Læser typisk med 5.000–7.000 MB/s. Det betyder, at en 14B-model indlæses i RAM på under 2 sekunder ved opstart. Du får også plads til FIM (Fill-in-the-Middle) varianter og Docker-containere.
Valg af Model (Qwen2.5)
At afvikle modellerne er muligt via f.eks. IPEX-LLM Docker (ollama run qwen2.5-coder:7b) eller Llama.cpp med SYCL-backend. Her er forskellen på de to giganter:
Qwen2.5-Coder-7B
Uovertruffen i sin størrelsesklasse til Python, C++ og PHP. Trænet på 5,5 billioner tokens med GQA og FIM tokens til auto-complete.
- Hukommelse: 4,3 GB (Q4) op til 9 GB (Q8).
- Kontekst: Fuld understøttelse af 128K tokens.
- Ydeevne: 15-30 tokens/sek med IPEX. Lynhurtigt i VS Code.
Qwen2.5-14B
Mærkbart løft i logisk tænkning, matematik og dansk sprogforståelse (MMLU > 85). Består af 48 transformer-lag.
- Hukommelse: 9-10 GB plads (Q4).
- Kontekst: 128K (eller 1M i instruct-varianten).
- Ydeevne: 7-15 tokens/sek via iGPU. Falder til 4-8 tokens/sek hvis CPU'en må tage over.