รีวิว repo
llama.cpp รันโมเดลภาษาได้บนฮาร์ดแวร์เกือบทุกแบบ ไม่ต้องมีการ์ดจอแรงก็ใช้ได้
llama.cpp คือเอนจินรันโมเดลภาษาที่เขียนด้วย C/C++ ล้วน ไม่มี dependency ภายนอกแม้แต่ตัวเดียว — รองรับฮาร์ดแวร์ถึง 17 แบบ ตั้งแต่การ์ดจอ NVIDIA, AMD, Apple Silicon ไปจนถึงซีพียูธรรมดาที่ไม่มีการ์ดจอเลย เพราะมีเทคนิคบีบขนาดโมเดล (quantization) ให้เลือกหลายระดับ
ทำได้ตรง ๆ แบบนี้
- รันโมเดลได้บนฮาร์ดแวร์เกือบทุกแบบ ทั้งการ์ดจอ NVIDIA, AMD, Apple Silicon และซีพียูล้วนที่ไม่มีการ์ดจอเลย
- บีบขนาดโมเดลได้ตั้งแต่ 1.5 บิตถึง 8 บิต กินแรมน้อยลงมาก แลกกับความแม่นยำที่ลดลงบ้างตามระดับที่เลือก
- พิมพ์คำสั่งเดียวดึงโมเดลจาก Hugging Face มารันได้ทันที ไม่ต้องดาวน์โหลดแยกเอง
- เปิดเป็นเซิร์ฟเวอร์ API แบบ OpenAI-compatible พร้อมหน้าเว็บแชทในตัว ไม่ต้องติดตั้งเครื่องมือเสริม
17backend ฮาร์ดแวร์ที่รองรับ
ตั้งแต่การ์ดจอ NVIDIA/AMD/Apple ไปจนถึงชิป Snapdragon, IBM Z และซีพียูธรรมดา — อ้างจากตาราง Supported backends ใน README ของ ggml-org/llama.cpp อ่านสดวันนี้ (2026-09-16) ไม่ได้ใช้จำนวนดาว 128,432 ดวงเป็นเหตุผลหลักตามกฎ repo-review ข้อ 4
ดึงโมเดลจาก Hugging Face มารันได้ทันทีด้วยคำสั่งเดียว
llama cli -hf ggml-org/Qwen3.5-0.8B-GGUFคัดลอกตรงจาก README ทางการของ ggml-org/llama.cpp (เช็ค 2026-09-16) — ⛔️ ผมยังไม่ได้รันจริงในเครื่อง เพราะต้องดาวน์โหลดไฟล์โมเดล GGUF ขนาดหลัก GB มาเก็บไว้ก่อน ยังไม่อยากลงเพิ่มในเครื่องที่ใช้ทำงานทุกวันโดยไม่ถามพี่ก่อน · อยากได้เซิร์ฟเวอร์พร้อมหน้าเว็บแชทในตัว ใช้ `llama serve -hf ggml-org/Qwen3.5-0.8B-GGUF` แทนคำสั่งเดียวกัน