Del 2: Maskinrummet

Hardware &
Qwen Modellerne

Minimumskravene for at køre Qwen2.5-Coder-7B og Qwen2.5-14B med Intel GPU og IPEX er en 11. generations Intel Core-processor med Iris Xe-grafik, mindst 16 GB RAM på Linux (20-24 GB på Windows 11) samt 128-256 GB SSD-lager. Her er de konkrete krav specificeret for begge modeller samt begrundelsen for konfigurationen.

CPU & Intel GPU

IPEX (Intel Extension for PyTorch) og IPEX-LLM udnytter Intels XPU/oneAPI Level-Zero runtime:

  • Minimum CPU: Intel Core 11. gen (Tiger Lake) eller nyere. Ældre understøtter ikke OneAPI/Level-Zero.
  • Minimum GPU: Intel Iris Xe (96 EUs) eller Intel Arc Graphics.

SSD Lagerplads

  • Model-vægte: 7B fylder 5-8 GB. 14B fylder 9-15 GB.
  • Software-stack: Docker, OneAPI, drivere og IPEX fylder 20–30 GB.
  • Minimum: 128 GB (Linux dedikeret) eller 256 GB (Windows 11).

System RAM (Shared Memory)

Et integreret Intel-grafikkort trækker på system-RAM. Kravene afhænger af styresystem og modelvægt:

For Qwen2.5-Coder-7B

Linux: 12-16 GB RAM (OS bruger 1-2 GB).

Win 11: 16 GB RAM (OS bruger 4-6 GB).

For Qwen2.5-14B

Linux: 16 GB (Minimum, snæver kontekst).

Win 11: 24 GB RAM (16 GB vil give OOM-fejl).

Hvorfor Core i9, 32 GB RAM og 1 TB SSD er en god idé

  • Intel Core i9 Mobile (H/HX-serien)

    Hurtig token-generering ved "offload": Hvis en stor 14B-prompt overstiger iGPU'ens rammer, skubbes beregninger over på CPU'en. i9-processoren har de højeste clock-frekvenser, hvilket minimerer ventetiden. H/HX-udgaverne har maksimale GPU-frekvenser og store L3-caches.

  • 32 GB RAM (Dual-Channel)

    Qwen2.5 understøtter op til 128.000 tokens. Jo længere kontekst, desto mere vokser KV-Cachen. Med 32 GB kan du tildele 10–12 GB til GPU'en, have plads til konteksten og stadig lade OS køre uden swapping. Dual-channel fordobler desuden hukommelsesbåndbredden.

  • 1 TB NVMe SSD

    Læser typisk med 5.000–7.000 MB/s. Det betyder, at en 14B-model indlæses i RAM på under 2 sekunder ved opstart. Du får også plads til FIM (Fill-in-the-Middle) varianter og Docker-containere.

Valg af Model (Qwen2.5)

At afvikle modellerne er muligt via f.eks. IPEX-LLM Docker (ollama run qwen2.5-coder:7b) eller Llama.cpp med SYCL-backend. Her er forskellen på de to giganter:

Den perfekte kombination

Qwen2.5-Coder-7B

Uovertruffen i sin størrelsesklasse til Python, C++ og PHP. Trænet på 5,5 billioner tokens med GQA og FIM tokens til auto-complete.

  • Hukommelse: 4,3 GB (Q4) op til 9 GB (Q8).
  • Kontekst: Fuld understøttelse af 128K tokens.
  • Ydeevne: 15-30 tokens/sek med IPEX. Lynhurtigt i VS Code.
Det gyldne midtpunkt

Qwen2.5-14B

Mærkbart løft i logisk tænkning, matematik og dansk sprogforståelse (MMLU > 85). Består af 48 transformer-lag.

  • Hukommelse: 9-10 GB plads (Q4).
  • Kontekst: 128K (eller 1M i instruct-varianten).
  • Ydeevne: 7-15 tokens/sek via iGPU. Falder til 4-8 tokens/sek hvis CPU'en må tage over.