22 กันยายน 2569
ที่มา: Hugging Face Blog
หมวด: ปัญญาประดิษฐ์
การรันโมเดลภาษาบนเครื่องของตัวเองแทนการส่งข้อมูลออกไปใช้บริการ AI ภายนอกกำลังง่ายขึ้นอีกขั้น Hugging Face เพิ่มความสามารถให้ไลบรารี Transformers ซึ่งนักพัฒนา AI ใช้กันแพร่หลายที่สุด อ่านไฟล์โมเดลแบบ GGUF ได้โดยตรง GGUF คือรูปแบบไฟล์ที่ย่อขนาดโมเดลด้วยการลดความละเอียดของตัวเลข (quantization) จนรันบนโน้ตบุ๊กได้ และเดิมผูกอยู่กับโปรแกรม llama.cpp ผลทดสอบบน MacBook Pro พบว่าความเร็วสร้างข้อความของ Transformers ตามหลัง llama.cpp เพียงราว 1 token ต่อวินาที
ก่อนหน้านี้นักพัฒนาต้องเลือกระหว่างสองโลก llama.cpp เหมาะกับการรันโมเดลย่อขนาดบนเครื่องทั่วไปอย่างรวดเร็ว ส่วน Transformers เหมาะกับการทดลอง ปรับแต่ง และประเมินผลโมเดลด้วย Python การรวมกันครั้งนี้ทำให้ใช้ไฟล์โมเดลชุดเดียวกันได้ทั้งสองทาง ผ่านคำสั่ง from_pretrained และ generate แบบเดิมที่นักพัฒนาคุ้นเคย แทนการแปลงไฟล์หรือสลับเครื่องมือ
ตัวอย่างที่ Hugging Face ใช้คือโมเดล Qwen3.5-4B ซึ่งไฟล์ความละเอียดเต็มมีขนาด 8.42 GB แต่เวอร์ชันย่อแบบ Q4_K_M เหลือเพียง 2.74 GB ส่วน Q5_K_M และ Q6_K อยู่ที่ 3.14 และ 3.53 GB คำแนะนำคือเริ่มจาก Q4_K_M ก่อน แล้วค่อยขยับไปใช้แบบที่ละเอียดกว่าถ้าหน่วยความจำพอ ความเร็วที่วัดบน MacBook Pro M2 Max หน่วยความจำ 32 GB คือราว 91 token ต่อวินาทีสำหรับโมเดล 4B เทียบกับ llama.cpp ราว 92 และสำหรับโมเดลขนาด 32B อยู่ที่ราว 32 เทียบกับ 33
ความเร็วนี้มาจากสองส่วน ส่วนแรกคือการนำชุดคำสั่งประมวลผลที่ปรับแต่งแล้วของ ggml ซึ่งเป็นแกนของ llama.cpp มาใช้ผ่านไลบรารี kernels ทำให้เร็วขึ้นราว 20-35% ตามสถาปัตยกรรมโมเดล ส่วนที่สองคือการปรับลูปการสร้างข้อความให้ทำงานซ้อนกันระหว่าง CPU และ GPU ได้มากขึ้น ซึ่งเร็วขึ้นอีกราว 10-15% และส่วนนี้ได้ประโยชน์กับทุกโมเดลใน Transformers ไม่เฉพาะไฟล์ GGUF นอกจากนี้ยังเปิดโมเดลเป็นบริการที่เรียกใช้ด้วยรูปแบบเดียวกับ API ของ OpenAI ได้ด้วยคำสั่ง transformers serve และนำไฟล์ GGUF ไปปรับแต่งต่อได้
ข้อจำกัดที่ Hugging Face ระบุเองคือเส้นทางความเร็วสูงตอนนี้ใช้ได้เฉพาะเครื่อง Mac ที่ใช้ชิป Apple ผ่าน MPS ส่วนอุปกรณ์อื่นยังโหลดได้แต่ไม่ได้ความเร็วแบบเดียวกัน รองรับเฉพาะโมเดลสถาปัตยกรรม Qwen3.5 และ Qwen3.8 การประมวลผลหลายคำขอพร้อมกันยังต้องปรับปรุง และต้องใช้ PyTorch สองรุ่นล่าสุดเท่านั้น จึงเหมาะกับการทดลองและงานวิจัยมากกว่าระบบใช้งานจริงในตอนนี้
สำหรับองค์กรไทยที่ลังเลจะส่งเอกสารภายในหรือข้อมูลลูกค้าเข้าบริการ AI ภายนอกเพราะข้อกังวลเรื่อง PDPA การรันโมเดลขนาดเล็กบนเครื่องขององค์กรเองกำลังเป็นทางเลือกที่ทำได้จริงมากขึ้น จุดเริ่มที่ดีคือทดลองกับงานที่ไม่ต้องใช้โมเดลใหญ่ เช่น สรุปเอกสาร จัดหมวดหมู่ข้อความ หรือค้นหาในฐานความรู้ภายใน แล้ววัดผลเทียบกับบริการภายนอกก่อนตัดสินใจลงทุน ทีมงาน Smart Cyber Tech ให้บริการที่ปรึกษาด้านการนำ AI มาใช้ในองค์กร ตั้งแต่เลือกโมเดลและที่รันจนถึงวางกติกาการใช้ข้อมูล ปรึกษาได้ที่ แบบฟอร์มติดต่อ
แหล่งข่าว เรียบเรียงจาก Hugging Face Blog —
อ่านต้นฉบับ ภาพปก: Hugging Face Blog · ลิขสิทธิ์ภาพเป็นของเจ้าของต้นฉบับ ใช้ประกอบการรายงานพร้อมอ้างอิงแหล่งที่มา
เนื้อหาบนหน้านี้เป็นการสรุปและเรียบเรียงเพื่อผู้อ่านชาวไทย หากพบข้อผิดพลาดโปรดแจ้งที่
info@smart-cyber-tech.com
บริการที่เกี่ยวข้องจากทีมงาน Smart Cyber Tech
แบ่งปันข่าวนี้:
LINE
Facebook
X
คัดลอกลิงก์
ปรึกษาทีมของเรา