
Qwen3.8-27B มาแล้ว: โมเดลโอเพนเวตที่ขยับจากแชตบอตสู่ผู้ช่วยลงมือทำ
ทีม Qwen เปิดให้นักพัฒนาดาวน์โหลด Qwen3.8-27B โมเดลภาษาแบบเปิดน้ำหนัก (open-weight) รุ่นใหม่ที่เน้นงานเขียนโค้ด การทำงานแบบ AI agent การวิจัย และการวิเคราะห์ภาพ–วิดีโอ โดยใช้พารามิเตอร์แบบ dense จำนวน 27,000 ล้านพารามิเตอร์ และเผยแพร่ภายใต้สัญญาอนุญาต Apache 2.0
ความสำคัญของรุ่นนี้อยู่ที่การขยับจากโมเดลที่ “ตอบคำถามได้ดี” ไปสู่โมเดลที่สามารถวางแผน ใช้เครื่องมือ อ่านสภาพแวดล้อม และทำงานหลายขั้นตอนจนจบได้อย่างน่าเชื่อถือมากขึ้น
Qwen3.8-27B เก่งขึ้นจาก Qwen3.6 อย่างไร
ตัวเลขในโมเดลการ์ดแสดงให้เห็นว่า Qwen3.8-27B ทำคะแนนสูงกว่า Qwen3.6-27B ในงานที่เกี่ยวกับการลงมือทำจริง ไม่ใช่แค่การตอบข้อสอบความรู้ทั่วไป
| การทดสอบ | Qwen3.6-27B | Qwen3.8-27B | เพิ่มขึ้น |
|---|---|---|---|
| Terminal Bench 2.1 | 63.4 | 73.0 | +9.6 |
| SWE-bench Pro | 53.5 | 61.7 | +8.2 |
| DeepSWE 1.1 | 13.3 | 42.2 | +28.9 |
| IFBench การทำตามคำสั่ง | 69.1 | 79.5 | +10.4 |
| HLE ความรู้และเหตุผลหลายสาขา | 24.0 | 30.8 | +6.8 |
| OSWorld การควบคุมคอมพิวเตอร์ | 63.9 | 84.3 | +20.4 |
| WebArena การใช้งานเว็บไซต์ | 48.8 | 64.8 | +16.0 |
จุดที่โดดเด่นที่สุดคือกลุ่มงาน agentic coding และ computer use เช่น การอ่าน repository ขนาดใหญ่ แก้ไขไฟล์ รันคำสั่ง เปิดเว็บไซต์ และตรวจสอบผลลัพธ์ก่อนทำขั้นตอนถัดไป ผลทดสอบ OSWorld เพิ่มขึ้นกว่า 20 คะแนน และ DeepSWE เพิ่มขึ้นเกือบ 29 คะแนนจากรุ่นก่อน
อย่างไรก็ตาม ตัวเลขทั้งหมดเป็นผลจากโมเดลการ์ดของผู้พัฒนา บางรายการเป็น benchmark ภายในและใช้ harness เฉพาะ แม้ Qwen จะระบุว่ามีการประเมิน baseline ใหม่ในสภาพแวดล้อมเดียวกัน จึงควรอ่านเป็นสัญญาณการพัฒนา ไม่ใช่หลักฐานว่าโมเดลชนะทุกงานในโลกจริง
เบื้องหลังการพัฒนา: ไม่ได้เพิ่มพารามิเตอร์อย่างเดียว
Qwen3.8-27B สร้างต่อบนพื้นฐานสถาปัตยกรรมของ Qwen3.5 แต่ปรับทั้งตัวโมเดลและ post-training ให้เหมาะกับงานระยะยาวมากขึ้น สิ่งที่ Qwen เปิดเผยในโมเดลการ์ดมีรายละเอียดทางเทคนิคที่น่าสนใจดังนี้
1. โมเดล dense 27B ที่ใช้โครงสร้างผสม
โมเดลมี 64 layers, hidden dimension 5,120 และจัดบล็อกเป็นกลุ่มซ้ำ 16 กลุ่ม โดยแต่ละกลุ่มประกอบด้วย
3 × (Gated DeltaNet → FFN) → 1 × (Gated Attention → FFN)
พูดง่าย ๆ คือไม่ได้ใช้ attention แบบเต็มทุกชั้น แต่ผสม Gated DeltaNet ซึ่งทำหน้าที่เก็บและอัปเดตสถานะของลำดับข้อมูลอย่างมีประสิทธิภาพ เข้ากับ Gated Attention ที่ช่วยให้โมเดลเชื่อมโยงข้อมูลระยะไกลแบบละเอียดได้
จาก layout นี้พออนุมานได้ว่า Qwenพยายามหาสมดุลระหว่างความสามารถในการอ่านบริบทยาวกับต้นทุนการประมวลผล ส่วนเหตุผลเชิงวิศวกรรมอย่างละเอียดและข้อมูลการฝึกแต่ละขั้นยังไม่ได้เปิดเผยทั้งหมดในโมเดลการ์ด
2. ใส่ความสามารถด้านภาพและวิดีโอไว้ในตัวโมเดล
Qwen3.8-27B เป็น causal language model ที่มี vision encoder อยู่ในระบบเดียวกัน จึงรับข้อความ ภาพ และวิดีโอได้โดยตรง ความสามารถที่ระบุไว้ครอบคลุมการอ่านเอกสาร แผนภาพทางวิทยาศาสตร์ กราฟ หน้าจอโปรแกรม และวิดีโอความยาวระดับชั่วโมง
นี่เป็นการเปลี่ยนแปลงที่สำคัญสำหรับ agent เพราะโมเดลไม่ได้ทำงานจากข้อความอย่างเดียว แต่สามารถดูหน้าจอ ตรวจผลจากเว็บไซต์ หรืออ่านเอกสารที่มีตารางและภาพประกอบก่อนตัดสินใจขั้นต่อไปได้
3. Pre-training ต่อด้วย post-training สำหรับงานที่ต้องทำจนจบ
Qwen ระบุว่าโมเดลผ่านทั้ง pre-training และ post-training แต่ยังไม่ได้เปิดเผยรายละเอียดทั้งหมดเกี่ยวกับชุดข้อมูล จำนวน GPU หรือสูตรการฝึกแบบ reinforcement learning
สิ่งที่เห็นได้จากความสามารถและ benchmark คือ post-training ให้ความสำคัญกับงานที่มีลำดับขั้น เช่น การเขียนโค้ดระดับ repository การใช้เครื่องมือ การทำงานบนเบราว์เซอร์ และการรับ feedback จากสภาพแวดล้อม จุดนี้ต่างจากการฝึกให้โมเดลตอบคำถามเป็นประโยคสวย ๆ เพียงอย่างเดียว เพราะโมเดลต้องรู้ว่าเมื่อใดควรตรวจสอบผล ลองใหม่ หรือเปลี่ยนแผน
4. ควบคุมระดับการคิดได้ตามงาน
Qwen3.8 เปิด Thinking mode เป็นค่าเริ่มต้น แต่ผู้ใช้สามารถปิดได้เมื่ออยากได้คำตอบเร็วขึ้น และปรับระดับการใช้เหตุผลผ่าน reasoning_effort ได้ 3 ระดับ ได้แก่ low, medium และ xhigh
นอกจากนี้ยังมี preserve_thinking สำหรับรักษาบริบทการคิดจากข้อความก่อนหน้า เหมาะกับงานหลายรอบ เช่น แก้โค้ดตาม feedback, วิเคราะห์เอกสารต่อเนื่อง หรือให้ agent ทำงานผ่านเครื่องมือหลายครั้ง
แนวทางนี้ทำให้โมเดลตัวเดียวใช้งานได้สองแบบ: ใช้โหมดคิดลึกเมื่อโจทย์ซับซ้อน และลดระดับการคิดเมื่อเน้น latency กับค่าใช้จ่าย
5. ฝึก Multi-Token Prediction เพื่อเปิดทางสู่การตอบที่เร็วขึ้น
โมเดลการ์ดระบุว่า Qwen3.8-27B ผ่านการฝึกด้วย Multi-Token Prediction (MTP) หลายขั้น ซึ่งเป็นแนวทางที่ให้โมเดลคาดการณ์ token ล่วงหน้ามากกว่าหนึ่งตัว เพื่อให้ runtime สามารถตรวจรับ token เป็นชุดแทนการสร้างทีละตัว
ชุมชน Unsloth ได้จัดทำรุ่น GGUF และระบุว่ารองรับ MTP สำหรับการอนุมานเร็วขึ้น แต่ความเร็วจริงยังขึ้นอยู่กับ backend, quantization, GPU และขนาดบริบทที่ใช้
บริบท 262K และการรันบนเครื่องส่วนตัว
Qwen3.8-27B รองรับบริบท 262,144 token โดยกำเนิด และสามารถขยายได้สูงสุดประมาณ 1 ล้าน token จุดนี้เหมาะกับการอ่าน repository, เอกสารจำนวนมาก หรือการทำงานแบบ agent ที่ต้องเก็บสถานะหลายขั้นตอน
แต่บริบทที่ยาวไม่ได้แปลว่าใช้ได้เต็มขนาดบนเครื่องทุกเครื่อง เพราะ KV cache จะใช้หน่วยความจำเพิ่มตามจำนวน token ชุมชนประเมินว่า full 262K context ในโหมดความแม่นยำสูงอาจต้องใช้ KV cache เพิ่มประมาณ 16GB นอกเหนือจากพื้นที่สำหรับ weights ดังนั้นการรันจริงควรเลือกระดับ quantization ให้เหมาะกับ RAM หรือ VRAM ที่มี
ข้อดีคือมีรุ่นบีบอัดหลายแบบสำหรับ llama.cpp, Ollama, LM Studio และเครื่องมืออื่น ๆ โดย Unsloth ระบุว่า Dynamic GGUF บางรุ่นเริ่มใช้งานได้ด้วยหน่วยความจำราว 17GB แต่ตัวเลขนี้เป็นค่าประมาณสำหรับรุ่น quantization และการตั้งค่าบางแบบ ไม่ใช่ข้อกำหนดตายตัวของโมเดล
ดาวน์โหลดโมเดล
มีเพียง 2 ช่องทางหลักเพื่อไม่ให้สับสน
- Qwen3.8-27B ต้นฉบับจาก Qwen — สำหรับ Transformers, vLLM และ SGLang
- Qwen3.8-27B MLX 4-bit จาก MLX Community — รุ่นประหยัดหน่วยความจำสำหรับ Mac Apple Silicon
หากกดหน้า Hugging Face ไม่ได้ ให้ดาวน์โหลดผ่าน command line แทน:
python -m pip install -U huggingface_hub
hf download Qwen/Qwen3.8-27B --local-dir ./Qwen3.8-27B
MLX ใช้ได้เมื่อไหร่
สำหรับผู้ใช้ Mac คำตอบคือ ใช้ได้แล้ว ณ วันที่เผยแพร่บทความนี้ โดยชุมชน MLX มีรุ่น Qwen3.8-27B ที่แปลงเป็นรูปแบบ MLX แล้วหลายระดับ ทั้ง 4-bit, 8-bit, BF16, MXFP4, MXFP8 และ NVFP4 รวมถึง MTP drafter สำหรับ speculative decoding
รุ่น 4-bit ระบุว่าแปลงจาก Qwen/Qwen3.8-27B ด้วย mlx-vlm และพร้อมใช้กับภาพโดยตรง ดังนั้นไม่จำเป็นต้องรอ conversion จากทีม Qwen อย่างเป็นทางการ แต่ควรเข้าใจว่านี่เป็นรุ่นที่ชุมชนแปลงและดูแลเอง อาจมีความแตกต่างด้านความเร็วหรือความเข้ากันได้จาก weights ต้นฉบับ
ตัวอย่างการรันบน Mac Apple Silicon:
pip install -U mlx-vlm
python -m mlx_vlm.generate \
--model mlx-community/Qwen3.8-27B-4bit \
--max-tokens 256 \
--temperature 0.0 \
--prompt "อธิบายภาพนี้" \
--image ./image.jpg
เนื่องจาก Qwen3.8-27B เป็นโมเดล vision-language การใช้ mlx-vlm จึงเหมาะกว่า mlx-lm เมื่อจะวิเคราะห์ภาพหรือวิดีโอ ส่วนผู้ที่ใช้ข้อความอย่างเดียวควรตรวจสอบ compatibility ของเวอร์ชัน MLX และเลือก checkpoint ที่ตรงกับ workflow ก่อนดาวน์โหลด
จุดที่น่าสนใจสำหรับนักพัฒนา
- เปิดน้ำหนักและใช้ Apache 2.0 เหมาะกับการรันภายในองค์กรและการปรับแต่งต่อ
- รองรับข้อความ ภาพ และวิดีโอ ในโมเดลเดียว ลดความซับซ้อนของระบบ multimodal
- ทำงานกับเครื่องมือ agent ได้ดีขึ้น โดยเฉพาะ coding, browser และ computer use
- ปรับระดับการคิดได้ ช่วยควบคุมความเร็ว คุณภาพ และต้นทุนตามประเภทงาน
- รองรับบริบทขนาดใหญ่ เหมาะกับ repository และเอกสารที่ยาวมาก
- มี ecosystem สำหรับ local inference ตั้งแต่วันแรก ทั้ง Transformers, vLLM, SGLang, GGUF และ MLX
สรุป
Qwen3.8-27B เป็นการอัปเกรดที่เน้น “ความสามารถในการทำงานจนจบ” มากกว่าการเพิ่มคะแนนสนทนาเพียงอย่างเดียว เบื้องหลังคือการผสม Gated DeltaNet กับ Gated Attention, การใส่ vision encoder, การฝึก MTP และ post-training ที่มุ่งไปยัง coding และ agentic tasks
โมเดลยังไม่ใช่คำตอบที่ดีที่สุดสำหรับทุกงาน และการใช้บริบทเต็มขนาดต้องแลกกับหน่วยความจำจำนวนมาก แต่สำหรับผู้ที่ต้องการโมเดล open-weight ขนาดกลางที่อ่านโค้ด ดูภาพ ใช้เครื่องมือ และรันในเครื่องตัวเองได้ Qwen3.8-27B ถือเป็นหนึ่งในรุ่นที่น่าจับตามองที่สุดของปี 2026
ความคิดเห็น
กำลังโหลดความคิดเห็น...