NokkaKimi ครอง Design Arena, แต่แพ้ 4 ใน 5 รอบในคลิปเดียวกัน โดย Nokka (นก-กา) | 12 กันยายน...
โดย Nokka (นก-กา) | 12 กันยายน 2026
บทความนี้เขียนโดย AI (deepseek-v4.1-flash) ผ่าน Hermes Agent ตรวจสอบและเรียบเรียงโดย Nokka
ชื่อคลิปบน YouTube บอกว่า "ทำไมนักพัฒนาที่ฉลาดถึงเลือกใช้ Kimi ทำงานออกแบบ" [1]
คำโปรยของคลิปยิ่งหนักแน่นกว่านั้น
Kimi อยู่บนสุดของ Design Arena เหนือกว่าโมเดลทุกตัวจากค่ายใหญ่ ดังนั้นผมจึงจับ Kimi K3 มาชนกับ Fable และ Astra ในงานออกแบบห้าชิ้น
ผมดูคลิปนั้นจบ และผลลัพธ์ที่ได้กลับไม่ตรงกับชื่อคลิปเลย
ช่อง Better Stack มีผู้ติดตาม 202,000 คน เผยแพร่คลิปความยาว 6 นาที 36 วินาที เมื่อวันที่ 12 กันยายน 2026 และมียอดชม 4,632 ครั้งในวันแรก [1]
การทดสอบคือจับสามโมเดลมาทำงานห้าชิ้นแบบครั้งเดียวจบ หรือ one-shot คือให้โจทย์แล้วใช้ผลลัพธ์ครั้งแรกโดยไม่แก้อะไร [1]
งานทั้งห้าคือหน้าแลนดิ้ง ฉากสามมิติ ไลบรารีคอมโพเนนต์ แอปมือถือ และเกมที่ต้องสร้างแอสเซตเอง [1]
ผมสรุปผลทั้งห้ารอบไว้ตรงนี้ เพราะนี่คือส่วนที่ชื่อคลิปไม่ได้เล่า [1]
รอบที่หนึ่ง หน้าแลนดิ้ง: Kimi ชนะ ได้คำชมเรื่องแอนิเมชัน การจัดตัวอักษร และความลื่นไหลของประสบการณ์ใช้งาน [1]
รอบที่สอง ฉากสามมิติ: Astra ชนะ ได้ผลลัพธ์ที่กลมกลืนที่สุดเมื่อเทียบกับอีกสองตัวที่ออกมาเป็นบล็อก ๆ [1]
รอบที่สาม ไลบรารีคอมโพเนนต์: เสมอกันทั้งสามตัว ผู้ทำคลิปบอกว่าคุณภาพใกล้กันจนตัดสินเป็นเรื่องของรสนิยมล้วน ๆ [1]
รอบที่สี่ แอปมือถือ: ไม่ให้คะแนนใครเลย ผู้ทำคลิปตัดสินว่าทั้งสามตัวได้ผลลัพธ์ที่จืดชืด เป็นบล็อก ๆ และคุณภาพแย่ [1]
รอบที่ห้า เกมพร้อมแอสเซต: Claude ชนะ ได้แอนิเมชันและรายละเอียดที่เรียบร้อยที่สุด Kimi ได้ที่สอง ส่วน Astra อ่อนที่สุดในรอบนี้ [1]
นับรวมแล้ว Kimi ชนะหนึ่งรอบ Astra ชนะหนึ่งรอบ Claude ชนะหนึ่งรอบ เสมอหนึ่งรอบ และไม่มีใครชนะหนึ่งรอบ
ไม่มีโมเดลไหนนำใครได้เลย
ตอนนี้เป็นส่วนที่ผมไปตรวจสอบเอง เพราะคำกล่าวอ้างนี้ถูกต้องตามข้อมูล แต่ต้องอ่านให้ครบ
หน้าโปรไฟล์ Kimi K3 บน Design Arena ระบุว่าเป็นโมเดลที่ "ถูกจัดอยู่ในอันดับหนึ่งบ่อยที่สุด" จากทั้งหมด 8,650 การแข่งขัน โดยมีอัตราชนะรวม 64% และคะแนน Elo 1383 [2]
ตัวเลขรายหมวดน่าสนใจกว่า และตรงกับที่ผมเห็นในคลิป [2]
| หมวด | อันดับ | อัตราชนะ |
|---|---|---|
| หน้าแลนดิ้ง | ที่ 1 จาก 172 | 61% |
| การแสดงข้อมูล | ที่ 1 จาก 160 | 64% |
| ฉากสามมิติ | ที่ 2 จาก 152 | 69% |
| แอปมือถือ | ที่ 2 จาก 159 | 58% |
| เกม | ที่ 3 จาก 164 | 63% |
| ไลบรารี UI | ที่ 4 จาก 159 | 63% |
ดูตามนี้จะเห็นว่าคำกล่าวอ้างในคลิปถูกต้อง เพราะ Kimi ครองอันดับหนึ่งในหมวดหน้าแลนดิ้งและการแสดงข้อมูลจริง และอยู่อันดับสองหรือสามในหมวดอื่น
แต่ "อันดับหนึ่งบ่อยที่สุด" กับการชนะทุกครั้งเป็นคนละเรื่องกัน และนั่นคือสิ่งที่คลิปนี้พิสูจน์โดยไม่ตั้งใจ
Kimi K3 ไม่ได้เพิ่งเป็นที่พูดถึงแค่ใน Design Arena
The New Stack รายงานว่าเมื่อ Kimi K3 เปิดตัว ภายในไม่กี่ชั่วโมงมันไต่ขึ้นเป็นอันดับหนึ่งบน leaderboard ด้าน frontend coding ของ Arena โดยเอาชนะระบบปิดชั้นนำในผลการประเมินแบบ blind [4]
และหลายสำนักระบุตรงกันว่าเป็นครั้งแรกที่โมเดลเปิดน้ำหนักขึ้นอันดับหนึ่งบน leaderboard ที่ตัดสินด้วยความชอบของคน [6][7]
ตัวเลขบน leaderboard หมวด code ของ Arena เองก็ยืนยันทิศทางเดียวกัน โดย Kimi K3 ได้คะแนนเหนือคู่แข่งในกลุ่มโมเดลปิด [5]
ส่วนคะแนนที่ Vals AI ซึ่งเป็นผู้ทดสอบอิสระวัดได้ Kimi K3 ทำได้ 95.10% บน SWE-bench Verified และ 91.27% บน Vibe Code Bench ซึ่งเป็นชุดย่อยของ Vals Index ทั้งคู่ [8]
ตัวเลขเหล่านี้ทำให้คำโปรยของคลิปที่ว่า "Kimi อยู่บนสุดของ Design Arena" ไม่ใช่คำกล่าวอ้างลอย ๆ แต่มันเป็นความจริงที่ต้องอ่านให้ถูกบริบท
คำโปรยของคลิปคือ "โมเดลที่คุณจ่ายเงินอยู่ อาจไม่ใช่ตัวที่คุณควรใช้" [1]
ผมเห็นด้วยกับประโยคนี้ แต่ผมคิดว่าคลิปนี้ให้บทเรียนที่ตรงกว่าตัวเอง
งานออกแบบหนึ่งชิ้นไม่ใช่การวัดที่แม่นพอจะบอกว่าโมเดลไหนเก่งกว่า เพราะหนึ่งชิ้นงานมีตัวแปรเยอะ ทั้งการสุ่มของโมเดล ลักษณะโจทย์ และความชอบส่วนตัวของผู้ตัดสิน
นี่คือเหตุผลว่าทำไม leaderboard ถึงใช้การแข่งขันหลายพันครั้งในการจัดอันดับ แต่คลิปใช้แค่ห้าครั้ง
ทั้งสองแบบมีประโยชน์ต่างกัน leaderboard บอกว่าค่าเฉลี่ยของโมเดลอยู่ตรงไหน ส่วนการทดสอบห้าชิ้นบอกว่าครั้งนี้เกิดอะไรขึ้น
ถ้าผลออกมาไม่ตรงกัน สิ่งที่ผิดไม่ใช่ข้อมูลชุดใดชุดหนึ่ง แต่วิธีที่เราเอาข้อมูลชุดหนึ่งไปสรุปอีกชุดหนึ่งต่างหาก
ช่องนี้เปิดให้แสดงความคิดเห็น และมีข้อวิจารณ์หนึ่งที่ตรงประเด็น
ผู้ชมคนหนึ่งตั้งข้อสังเกตว่าคลิปไม่ได้ระบุชื่อโมเดลที่ใช้อย่างชัดเจน [1]
ผมตรวจสอบแล้วพบว่าเรื่องนี้เป็นจริงในระดับหนึ่ง คลิปใช้ชื่อ "Kimi", "Claude" และ "Astra" ลอย ๆ โดยไม่บอกเวอร์ชันของแต่ละตัวในเนื้อหาหลัก
สำหรับ Claude คลิปไม่ได้บอกว่าใช้ Fable 5.1 หรือรุ่นไหน ส่วนคำโปรยบอกว่า "Fable และ Astra" แต่ในเนื้อหาพูดถึง Astra ในฐานะ GPT-6 Astra [1][3]
จุดนี้สำคัญเพราะเมื่อไม่ระบุเวอร์ชัน ผลการทดสอบจะเปรียบเทียบกับอะไรก็ไม่รู้ และไม่มีใครทำซ้ำได้
ในคอมเมนต์ใต้คลิป มีผู้ชมเขียนไว้ประมาณว่า [1]
เวลาโมเดลใหม่เปิดตัว ทุกคนจับจ้องแต่ส่วนติดต่อผู้ใช้ ทั้งที่ส่วนติดต่อไม่ใช่งานวิศวกรรมจริง ๆ ตรรกะที่อยู่ข้างในต่างหากที่สำคัญ ส่วนที่เห็นสวย ๆ มีประโยชน์แค่ในงานโชว์และพอร์ตโฟลิโอ
ผมคิดว่าคอมเมนต์นี้ตรงกับสิ่งที่ผมเห็นในคลิปมาก เพราะห้าจานทดสอบของคลิปนี้เป็นงานที่มองเห็นผลทันทีทั้งหมด ไม่มีงานที่ต้องแก้บั๊กซับซ้อนหรือดูแลโค้ดระยะยาวเลย [1]
ผลจากการวัดแบบนี้จึงบอกความสามารถเรื่องหน้าตาได้ดี แต่บอกความสามารถเรื่องความทนทานของโค้ดไม่ได้
ผมเจอสถานการณ์แบบนี้ตลอด เพราะผมเลือกโมเดลตามงาน ไม่ได้เลือกตามอันดับ
โมเดลที่ตัวเลขสูงสุดบน leaderboard อาจเขียนงานประเภทนี้ได้แย่กว่าโมเดลที่อันดับต่ำกว่าสองสามอันดับ เพราะความถนัดเฉพาะทางของแต่ละตัวต่างกันจริง
สิ่งที่ผมทำเวลาอ่านผลทดสอบคือถามสามข้อ
หนึ่ง งานที่ทดสอบเหมือนงานที่ผมจะทำไหม งานออกแบบหน้าแลนดิ้งกับงานเขียนบทความยาวเป็นคนละทักษะ
สอง ทดสอบกี่ครั้ง ห้าครั้งต่างจากแปดพันครั้งมาก และผลที่ได้ควรถูกอ่านให้ต่างกัน
สาม ผู้ตัดสินเป็นใคร ถ้าเป็นคนเดียว ความชอบส่วนตัวของคน ๆ นั้นคือตัวแปรที่ใหญ่ที่สุดในผลลัพธ์
อย่างแรก ถ้าคุณเห็นคลิปหรือโพสต์ที่บอกว่าโมเดลหนึ่งชนะ ให้ดูจำนวนงานที่ทดสอบก่อน ถ้าน้อยกว่าสิบครั้ง ให้อ่านเป็นกรณีศึกษา ไม่ใช่การจัดอันดับ
อย่างที่สอง ถ้าคุณใช้ AI ออกแบบงานจริง ลองทดสอบกับงานของคุณเองสักห้าชิ้นแล้วตัดสิน โดยใช้ leaderboard เป็นแค่ตัวช่วยกรองตัวเลือกแรก ไม่ใช่คำตัดสินสุดท้าย [2]
อย่างที่สาม ระวังการจับคู่ชื่อคลิปกับคำโปรย เพราะชื่อคลิปเป็นเรื่องการตลาด ส่วนคำโปรยเป็นเรื่องของคนทำคลิปที่ต้องขายไอเดีย และส่วนที่บอกความจริงคือเนื้อหาข้างใน
หนึ่ง ผมไม่ได้ดูวิดีโอทั้งคลิปด้วยเสียงของตัวเอง เพราะ YouTube บล็อกการเข้าถึงจากเซิร์ฟเวอร์ที่ผมใช้ดึงข้อมูล สิ่งที่ผมอ่านได้คือชื่อคลิป คำโปรย บทบรรยาย และคอมเมนต์ที่แสดงบนหน้าเว็บ ซึ่งรวมผลการตัดสินทั้งห้ารอบและช่วงเวลาของแต่ละรอบ [1]
สอง ผมไม่ทราบว่าโมเดลที่ใช้ในแต่ละรอบเป็นเวอร์ชันใดแน่ชัด คลิปใช้ชื่อ Kimi, Claude และ Astra โดยไม่ระบุเวอร์ชันในเนื้อหาหลัก และนี่เป็นข้อจำกัดที่ผมวิจารณ์ไว้ในบทความเองด้วย [1]
สาม ตัวเลข Design Arena ที่ผมยกมาเป็นข้อมูล ณ วันที่ 12 กันยายน 2026 ซึ่งเป็นวันเดียวกับที่คลิปเผยแพร่ และเป็นวันที่ผมตรวจหน้าเว็บ ตัวเลขนี้เปลี่ยนได้ทุกวันตามการแข่งขันใหม่ [2]
สี่ ผมพบว่าชื่อ Astra และ Fable ที่คลิปใช้ ตรงกับโมเดลจริงที่เปิดตัวต้นเดือนกันยายน 2026 คือ GPT-6 Astra ของ OpenAI และ Claude Fable 5.1 ของ Anthropic [9] แต่ผมไม่ยืนยันว่าคลิปใช้เวอร์ชันหรือค่าระดับความพยายามใดในการทดสอบ เพราะคลิปไม่ระบุ [1]
ห้า ข้อวิจารณ์ในคอมเมนต์ที่ผมยกมาเป็นความเห็นของผู้ชม ไม่ใช่ข้อเท็จจริงที่ตรวจสอบได้ และผมไม่ได้ยืนยันว่าผู้เขียนคอมเมนต์ทำงานในวงการนี้หรือไม่ [1]
คลิปนี้ตั้งชื่อว่า "ทำไมนักพัฒนาที่ฉลาดถึงเลือก Kimi" แต่เนื้อหาข้างในกลับแสดงให้เห็นว่า Kimi ชนะหนึ่งในห้ารอบเท่ากับคู่แข่งอีกสองตัว
ผมไม่คิดว่านี่เป็นข้อบกพร่องของคนทำคลิป เพราะคำโปรยของเขาบอกไว้ตรง ๆ ว่าอยากให้คนตั้งคำถามกับโมเดลที่ตัวเองจ่ายเงินอยู่ [1]
แต่ผมคิดว่านี่คือบทเรียนที่ดีกว่าที่คลิปตั้งใจจะสอน นั่นคือ อันดับหนึ่งบน leaderboard กับการชนะในงานที่คุณกำลังทำอยู่ เป็นสองเรื่องที่แยกกัน
คำถามที่ผมคิดว่าควรถามเวลาอ่านผลทดสอบแบบนี้คือ ถ้าผลออกมาตรงข้ามกับที่คุณคาด คุณจะเชื่อตัวเลข หรือเชื่องานที่วางอยู่ตรงหน้าคุณ
ถ้าคุณเคยเจอเคสแบบนี้ คือผลทดสอบบอกอย่าง แต่ใช้งานจริงได้อีกอย่าง ลองแชร์ให้ผมฟังได้ เพราะกรณีแบบนั้นสอนได้มากกว่าตัวเลขบน leaderboard
[1] Better Stack, "Why Smart Developers Use Kimi For Design" (YouTube, 12 ก.ย. 2026), https://www.youtube.com/watch?v=zx9xhp7wB9M
[2] Design Arena, โปรไฟล์และอันดับของ Kimi K3 (สืบค้น 12 ก.ย. 2026), https://www.designarena.ai/models/kimi-k3
[3] Design Arena, รายชื่อโมเดลที่ประเมิน (สืบค้น 12 ก.ย. 2026), https://www.designarena.ai/models
[4] The New Stack, "Kimi K3 tops Arena's coding leaderboard and it's open-weight" (2026), https://thenewstack.io/kimi-k3-open-weight-coding/
[5] Design Arena, leaderboard หมวด Code (สืบค้น 12 ก.ย. 2026), https://www.designarena.ai/leaderboard/code
[6] Kilo, "Kimi K3 Just Took the #1 Spot for Frontend. We Put It Against Claude Fable 5 on 10 UIs" (2026), https://blog.kilo.ai/p/kimi-k3
[7] Data Science Dojo, "Kimi K3 vs Claude Fable 5: Benchmarks compared" (2026), https://datasciencedojo.com/blog/kimi-k3-vs-claude-fable-5/
[8] Vals AI, ผลการประเมิน Kimi K3 บน Vals Index (16 ก.ค. 2026), https://www.vals.ai/models/kimi_kimi-k3
[9] DataCamp, "GPT-6 Astra vs Claude Fable 5.1: Benchmarks and Pricing" (ก.ย. 2026), https://www.datacamp.com/blog/gpt-6-astra-vs-claude-fable-5-1