DGX Spark (PGX)
Spécifications
- Modèle : NVIDIA DGX Spark (Lenovo ThinkStation PGX)
- GPU : NVIDIA GB10 Blackwell
- Mémoire : 121 Go unifiée (RAM + VRAM)
- CPU : ARM 20 coeurs
- CUDA : 13.0
- Stockage : 3.6 To NVMe
- OS : Ubuntu 24.04
Accès
Utilisateurs
| User | UID | Groupes |
| younes | 1002 | users, docker |
| alain | 1000 | - |
| pgp667 | 1001 | docker |
| lucas | 1003 | - |
| selma | 1004 | - |
| rami | 1005 | users, docker |
Configuration IA actuelle (mai 2026)
Attention : Le PGX est reconfiguré régulièrement par d'autres utilisateurs (alain, pgp667). Les ports et modèles peuvent changer sans préavis.
- Modèle : nvidia/Gemma-4-26B-A4B-NVFP4
- Nom servi : hal-chat
- Port vLLM : 8101 (localhost only)
- Proxy socat : 0.0.0.0:8200 -> 127.0.0.1:8101
Historique des modèles
| # | Modèle | Port | Nom servi | Période |
| 1 | Qwen2.5-32B-AWQ | 8104 | general | Avril-Mai |
| 2 | DeepSeek-R1-Distill-Qwen-32B-AWQ | 8103 | reasoning-lite | Avril-Mai |
| 3 | Qwen2.5-VL-7B | 8105 | vision-lite | Avril-Mai |
| 4 | Gemma-4-26B-A4B-it | 8101 | hal-9001-chat | Mai |
| 5 | Qwen2.5-Coder-14B | 8102 | hal-9001-code | Mai |
| 6 | Qwen3-Coder-30B-FP8 | 8000 | - | Mai |
| 7 | DeepSeek-R1-Distill-Qwen-32B-AWQ | 8001 | hal9001-supreme | Mai |
| 8 | Gemma-4-26B-A4B-NVFP4 | 8101 | hal-chat | Mai (actuel) |
Services Docker
| Container | Port | Rôle |
| hal-vllm-chat | 8101 (local) | Modèle IA principal |
| moodle-proxy (socat) | 8200 | Proxy pour accès externe |
| hal-litellm | 4000 | Routeur multi-modèles |
| hal-open-webui | 3000 | Interface web |
| hal-searxng | 8080 | Moteur de recherche |
| hal-qdrant | - | Base vectorielle |
GPU : surveiller la mémoire
Les processus vLLM zombies peuvent occuper la mémoire GPU. Pour vérifier :
nvidia-smi --query-compute-apps=pid,name,used_memory --format=csv,noheader
Pour tuer un processus zombie :
sudo kill -9 <PID>