🧠 Ollama Local LLM Benchmark

Serial Execution Analysis with Real-time System Monitoring

📊 Benchmark Summary

Total Duration

35min

Models Tested

6models

Data Points

1025samples

⚡ Performance Rankings (Tokens/sec)

🌡️ GPU Temperature During Benchmark

🔥 GPU Utilization & VRAM Usage Timeline

📋 Detailed Results

Rank Model Duration Tokens/sec Tokens Out GPU Power Status
🥇 qwen3.6:35b 174s 64.97 11,321 High Fastest
🥈 qwen3.5:35b-a3b-q4_K_M 242s 63.90 15,437 Medium Fast
🥉 gemma4:26b-a4b-it-q4_K_M 109s 70.44 7,697 Low Best TPS
4 qwen3.6:27b 372s 19.40 7,227 Medium Average
5 qwen3.6:27b-q4_K_M 588s 19.25 11,321 High Average
6 gemma4:31b-it-q4_K_M 536s 17.61 9,444 High Slowest

💾 System Specifications

Operating System Unraid OS 7.3.0
Kernel Linux 6.18.29-Unraid
CPU Cores 32 cores
RAM 128 GB
GPU 0 NVIDIA (Active)
GPU 1 NVIDIA (Secondary)
Netdata Version v2.10.0-255-nightly
Ollama Host 192.168.1.100:11434

📈 System Resource Summary

GPU0 Utilization Range 1% - 100% (avg: 46.7%)
GPU0 Temperature Range 51°C - 85°C (avg: 71°C)
GPU0 Power Range 23W - 189W (avg: 95W)
GPU0 VRAM Range 1.1GB - 14.1GB (avg: 2.3GB)
System Load Average 9.37 - 26.29 (avg: 14.31)
RAM Usage 832MB - 7.9GB (avg: 2.5GB)

🎯 Key Findings & Recommendations

📊 Model Comparison Matrix

Model Family Parameters Quantization Context VRAM (GB)
gemma4:26b-a4b Gemma4 26B Q4_K_M 128K ~20
gemma4:31b Gemma4 31B Q4_K_M 128K ~26
qwen3.5:35b Qwen3.5 35B Q4_K_M (A3B) 32K ~25
qwen3.6:35b Qwen3.6 35B Full (F16) 128K ~25
qwen3.6:27b-q4 Qwen3.6 27B Q4_K_M 128K ~26
qwen3.6:27b Qwen3.6 27B Full (F16) 128K ~22