คำตอบสั้นๆ
โมเดล AI เป็นตัวกำหนดว่า AI เก่งแค่ไหนและแต่ละโทเคนราคาเท่าไหร่ ส่วนระดับ effort กำหนดว่าโมเดลจะคิดก่อนตอบมากแค่ไหน และการคิดที่มองไม่เห็นนั้นก็คิดเงินในราคาโทเคน output วิธีไม่ให้จ่ายเกินคือเริ่มจากโมเดลที่เก่งพอด้วย effort ค่าเริ่มต้น แล้วค่อยๆ ลด effort จนคุณภาพบนเคสจริงของคุณเริ่มตก ก่อนจะเปลี่ยนไปใช้โมเดลที่ถูกกว่า และวัดผลจากต้นทุนต่อเคสที่ทำถูก ไม่ใช่ราคาต่อโทเคน
โมเดลกับระดับ effort ต่างกันยังไง
โมเดลเป็นตัวกำหนดว่า AI เก่งแค่ไหนและแต่ละโทเคนราคาเท่าไหร่ ส่วนระดับ effort เป็นตัวกำหนดว่าโมเดลจะคิดก่อนตอบมากแค่ไหน ซึ่งก็คือจำนวนโทเคนที่ต้องจ่ายนั่นเอง ทั้งสองปุ่มมีผลกับคุณภาพ ค่าใช้จ่าย และความเร็วพร้อมกัน
จุดเริ่มที่ดีคือใช้โมเดลที่เก่งพอด้วย effort ค่าเริ่มต้น วัดคุณภาพกับเคสจริงของตัวเอง แล้วค่อย ๆ ลด effort ลงจนคุณภาพเริ่มตก ลองวิธีนี้ก่อนจะเปลี่ยนไปใช้โมเดลที่ถูกกว่า และวัดผลจากต้นทุนต่อเคสที่ทำถูก ไม่ใช่ราคาต่อโทเคน
Effort ควบคุมอะไรจริง ๆ
โมเดลรุ่นใหม่คิดก่อนตอบได้ คือไล่แก้โจทย์เป็นข้อความที่ส่วนใหญ่มองไม่เห็น แล้วค่อยเขียนคำตอบ ค่า effort บอกโมเดลว่าควรคิดมากแค่ไหน ถ้าตั้งต่ำ โมเดลก็ตอบเร็วและคิดเฉพาะตอนเจอโจทย์ที่ยากชัด ๆ ถ้าตั้งสูง โมเดลจะคิดแทบทุกคำขอและคิดยาวขึ้นด้วย
effort เป็นสัญญาณบอกทิศทาง ไม่ใช่เพดานตายตัว เอกสารของ Anthropic ระบุว่าที่ระดับต่ำ Claude ยังคิดเมื่อเจอโจทย์ที่ยากพอ แค่คิดน้อยกว่าตอนตั้งระดับสูง ใน Claude ค่า effort ยังมีผลกับทุกอย่างที่โมเดลผลิตออกมาด้วย ตั้งต่ำก็เรียกเครื่องมือน้อยครั้งลง รวบหลายขั้นเป็นครั้งเดียว และไม่เกริ่นนำ ตั้งสูงก็อธิบายแผนก่อนลงมือ เรียกเครื่องมือมากขึ้น และสรุปละเอียดขึ้น
สิ่งที่ effort ทำได้ไม่แน่นอนคือทำให้คำตอบที่เห็นสั้นลง Anthropic ระบุว่าใน Claude Opus 5 การปรับ effort เปลี่ยนปริมาณการคิด ไม่ได้เปลี่ยนความยาวคำตอบ ถ้าอยากได้คำตอบสั้น ให้บอกไว้ใน prompt ตรง ๆ
ปุ่มเดียวกัน แต่สามค่ายเรียกคนละชื่อ
แต่ละค่ายตั้งชื่อและแบ่งระดับไม่เหมือนกัน ค่าเริ่มต้นก็ไม่เท่ากันด้วย เรื่องนี้สำคัญตอนเทียบราคาข้ามค่าย เพราะสองโมเดลที่ตั้งค่าเริ่มต้นทั้งคู่ อาจกำลังทำงานในปริมาณที่ต่างกันมาก
| Anthropic Claude | OpenAI GPT | Google Gemini | |
|---|---|---|---|
| ชื่อพารามิเตอร์ | effort | reasoning.effort | thinking_level |
| ระดับที่มี | low, medium, high, xhigh, max | none, minimal, low, medium, high, xhigh, max แต่ละโมเดลรองรับไม่ครบทุกระดับ | low, medium, high ในโมเดล Gemini 3 |
| ค่าเริ่มต้น | high | ต่างกันไปตามโมเดล GPT-5.5 ใช้ medium | Flash รุ่นปัจจุบันใช้ medium ส่วน 3.1 Pro ใช้ high |
| การคิดที่มองไม่เห็นคิดเงินแบบไหน | ราคา output | ราคา output | ราคา output คิดเต็มจำนวนแม้จะแสดงแค่บทสรุป |
| ของเดิมที่มาแทน | งบโทเคนสำหรับการคิดแบบตายตัว | ไม่มี | thinking_budget นับเป็นโทเคน ใน Gemini 2.5 |
ค่าใช้จ่ายที่มองไม่เห็นซ่อนอยู่ตรงไหน
ทั้งสามค่ายคิดเงินการคิดของโมเดลในราคา output ซึ่งเป็นฝั่งที่แพงกว่า อย่าง Claude Opus 5 ค่า input อยู่ที่ 5 ดอลลาร์ต่อล้านโทเคน แต่ output อยู่ที่ 25 ดอลลาร์ แพงกว่าห้าเท่า คำขอที่คิดไปหลายพันโทเคนก่อนตอบสองบรรทัด จึงอาจแพงกว่าที่คำตอบบอกไว้มาก
การคิดส่วนใหญ่ก็มองไม่เห็นด้วย OpenAI ส่งกลับมาแค่จำนวนโทเคนที่ใช้คิด Claude รุ่นใหม่ส่ง thinking block กลับมาแต่เป็นค่าว่างโดยค่าเริ่มต้น ส่วน Google คิดเงินการคิดเต็มจำนวนแม้จะแสดงแค่บทสรุป ทางเดียวที่จะรู้ว่าจ่ายไปกับอะไรคือดูตัวเลขโทเคนในข้อมูล usage ที่ API ส่งกลับมา
เพดาน output ที่ตั้งไว้ใช้ร่วมกันทั้งการคิดและคำตอบ ถ้าตั้งต่ำเกิน คำขอที่ effort สูงอาจใช้พื้นที่หมดก่อนได้เขียนคำตอบ OpenAI แนะนำให้เผื่อไว้อย่างน้อย 25,000 โทเคนตอนเริ่มทดลอง ส่วน Anthropic แนะนำให้เริ่มที่ 64,000 สำหรับ effort ระดับบนสุด
ผลวัดจริงบอกอะไร
ผลทดสอบที่ Anthropic เผยแพร่เองบอกว่า ลด effort แล้วจะเสียความแม่นมากหรือน้อย ขึ้นกับประเภทงานเป็นหลัก
งานค้นคว้าและงานความรู้แทบไม่ต่าง ระดับ medium แม่นเท่าค่าเริ่มต้นโดยใช้เงินแค่ 70 ถึง 85% ส่วนระดับ low เสียความแม่นไปแค่ 1 ถึง 3 คะแนนแต่ประหยัดได้หนึ่งในสามถึงครึ่งหนึ่ง งานเขียนโค้ดที่รันนานเป็นการแลกกันจริง ใน Claude Opus 5 ระดับ medium เสียราว 2 คะแนนแต่ประหยัดครึ่งหนึ่ง ระดับ low เสียราว 8 คะแนนแต่จ่ายแค่หนึ่งในสี่ ส่วนงานค้นคว้าเชิงลึกหลายหัวข้อ ได้คะแนนเพิ่มราว 2.4 ทุกครั้งที่ขยับขึ้นหนึ่งระดับ งานแบบนี้จึงไม่มีส่วนให้ลดฟรี ๆ
มีวิธีหนึ่งที่ดีกว่าการตั้งระดับเดียวตายตัว คือรันงานโค้ดทั้งหมดที่ระดับ low แล้วรันซ้ำเฉพาะงานที่ล้มเหลวที่ค่าเริ่มต้น ผลคือผ่านราว 93% ที่ต้นทุนราว 0.70 ดอลลาร์ต่องาน เทียบกับรันทั้งหมดที่ค่าเริ่มต้นซึ่งผ่าน 91.7% ที่ 1.39 ดอลลาร์ แต่วิธีนี้ต้องมีตัวตรวจจับงานที่พลาดได้อัตโนมัติ เช่น เทสต์หรือตัวตรวจความถูกต้อง
ควรเปลี่ยนโมเดลหรือลด effort ก่อน
ลองลด effort ก่อนเปลี่ยนไปใช้โมเดลที่ถูกกว่า Anthropic รายงานว่าโมเดลรุ่นใหม่ที่ effort ต่ำ มักทำได้เท่าหรือดีกว่าโมเดลรุ่นก่อนที่ effort สูง และการใช้โมเดลเดียวก็ทำให้ prompt cache ยังใช้ได้ เพราะ cache ไม่ข้ามไปใช้กับโมเดลอื่น
การเปลี่ยนโมเดลยังสมเหตุสมผลเมื่องานแคบและซ้ำ ๆ เมื่อความเร็วสำคัญกว่าความลึก หรือเมื่อโมเดลที่ถูกกว่าผ่านเทสต์ของคุณที่ระดับดีที่สุดของมันแล้ว ราคาปัจจุบันของ Anthropic ต่อล้านโทเคน input และ output ตามลำดับ คือ Claude Fable 5.1 อยู่ที่ 10 และ 50 ดอลลาร์ Opus 5 อยู่ที่ 5 และ 25 ดอลลาร์ Sonnet 5 อยู่ที่ 2 และ 10 ดอลลาร์ และ Haiku 4.5 อยู่ที่ 1 และ 5 ดอลลาร์
ถ้างานเป็นแค่การเลือกคำตอบจากรายการตายตัว เช่น ส่งตั๋วแจ้งปัญหาให้ถูกทีม หรือจัดหมวดเอกสาร ก็อาจไม่ต้องใช้โมเดลที่คิดเลย โมเดลตัดสินใจที่สร้างมาสำหรับงานนี้โดยเฉพาะถูกกว่ามาก รายละเอียดอยู่ในคู่มือ Jev กับ Laya
งานแต่ละแบบควรตั้ง effort ระดับไหน
งานจัดหมวดหรือดึงข้อมูลเริ่มที่ effort ต่ำ ส่วนงานวิเคราะห์ซับซ้อนและเขียนโค้ดเริ่มที่ high ทั้งหมดข้างล่างนี้เป็นจุดเริ่มสำหรับทดสอบ ไม่ใช่คำตอบสำเร็จรูป ระดับที่เหมาะขึ้นกับงานของแต่ละที่ และเปลี่ยนไปเมื่อเปลี่ยนโมเดล
- จัดหมวด ดึงข้อมูล คัดแยกงาน: effort ต่ำ หรือใช้โมเดลตัดสินใจแทน
- แชตตอบลูกค้าและตอบคำถามสั้น ๆ: low ถึง medium เพราะความเร็วสำคัญที่สุด
- สรุปเนื้อหา วิเคราะห์เอกสาร ร่างรายงาน: medium แล้วค่อยขยับขึ้นถ้าคุณภาพตก
- วิเคราะห์ซับซ้อนและโจทย์ที่ต้องใช้เหตุผลหนัก: high ซึ่งเป็นค่าเริ่มต้นของ Claude
- เขียนโค้ดและ agent ที่ทำงานต่อเนื่องนาน ๆ: high ถึง xhigh พร้อมตั้งเพดาน output ให้กว้าง
- max: ใช้เฉพาะเมื่อผลทดสอบเห็นว่าดีขึ้นจริงจากระดับก่อนหน้า งานที่ต้องตอบตามโครงสร้างบางแบบกลับคิดมากเกินจนแย่ลง
เลือกยังไงจากข้อมูลของตัวเอง
รวบรวมเคสจริงจากงานสัก 30 ถึง 100 เคส พร้อมจดคำตอบที่ถูกต้องไว้ แล้วรันทั้งหมดที่ effort สองหรือสามระดับบนโมเดลเดียวกัน โดยไม่เปลี่ยนอย่างอื่นเลย จดความแม่น จำนวนโทเคนรวม และเวลาที่ใช้ของแต่ละระดับไว้
เลือกระดับต่ำสุดที่ความแม่นยังรับได้ แล้วเทียบต้นทุนต่อเคสที่ทำถูก ไม่ใช่ต้นทุนต่อคำขอ คำขอที่ถูกกว่าแต่พลาดบ่อยกว่าหรือต้องรันซ้ำ สุดท้ายก็ไม่ได้ถูกกว่า
มีรายละเอียดอีกสองข้อ ข้อแรก การเปลี่ยน effort กลางบทสนทนามักทำให้ prompt cache เริ่มใหม่ จึงควรตั้งระดับเดียวต่อหนึ่ง workflow แต่ Claude รุ่นใหม่ล่าสุดเปลี่ยนระดับรายข้อความได้โดยไม่เสีย cache ข้อสอง ทุกครั้งที่เปลี่ยนโมเดลหรือแก้ prompt ต้องทดสอบใหม่ เพราะผลจะเปลี่ยนตามไปด้วย
ก่อนตั้งโมเดลและระดับ effort ตอบข้อเหล่านี้ให้ได้
- มีเคสจริงที่รู้คำตอบที่ถูกต้องไว้สำหรับทดสอบหรือยัง
- วัดผลอย่างน้อยสองระดับ effort บนโมเดลเดียวกันแล้วหรือยัง
- ดูจำนวนโทเคนจาก API รวมถึงโทเคนความคิดที่มองไม่เห็นด้วยหรือเปล่า
- เพดาน output พอสำหรับทั้งการคิดและคำตอบไหม
- เทียบต้นทุนต่อเคสที่ทำถูก ไม่ใช่ราคาต่อโทเคนหรือเปล่า
- งานนี้ต้องให้โมเดลคิดจริงไหม หรือแค่เลือกจากรายการตายตัว
- ตั้ง effort ไว้ระดับเดียวต่อ workflow เพื่อให้ cache ยังใช้ได้หรือเปล่า
- ถ้าเปลี่ยนโมเดลหรือแก้ prompt จะทดสอบใหม่ไหม
คำถามที่พบบ่อย
Effort ในโมเดล AI คืออะไร
Effort คือค่าที่บอกโมเดลแบบคิดก่อนตอบว่าควรทุ่มแรงกับแต่ละคำขอแค่ไหน ส่วนใหญ่คือปริมาณการคิดที่มองไม่เห็นก่อนตอบ ตั้งต่ำก็เร็วและถูก ตั้งสูงก็ละเอียดกว่า Anthropic เรียกว่า effort ส่วน OpenAI เรียกว่า reasoning effort และ Google เรียกว่า thinking level
ตั้ง effort สูงไว้ดีกว่าเสมอไหม
ไม่เสมอไป ในงานค้นคว้าและงานความรู้ Anthropic วัดได้ว่าเหนือระดับ medium แทบไม่ได้อะไรเพิ่ม แต่ค่าเริ่มต้นแพงกว่าราว 20 ถึง 40% effort สูงคุ้มกับงานโค้ดยาก ๆ agent ที่ทำงานนาน และงานค้นคว้าหลายขั้น ส่วนระดับสูงสุดอาจคิดมากเกินจนแย่ลงในงานที่ต้องตอบตามโครงสร้างง่าย ๆ
ต้องจ่ายเงินค่าการคิดของ AI ด้วยหรือเปล่า
ต้องจ่าย ทั้ง Claude, OpenAI และ Gemini คิดเงินโทเคนความคิดในราคา output ซึ่งมักแพงกว่า input หลายเท่า การคิดนั้นส่วนใหญ่มองไม่เห็น เห็นแค่เป็นตัวเลขจำนวนโทเคนในข้อมูล usage ของ API จึงควรดูตัวเลขนี้ทุกครั้งที่ประเมินค่าใช้จ่าย
ลด effort แล้วคำตอบจะสั้นลงไหม
ไม่แน่เสมอไป effort คุมปริมาณการคิดเป็นหลัก ไม่ได้คุมความยาวคำตอบที่เห็น Anthropic ระบุเรื่องนี้ไว้ชัดสำหรับ Claude Opus 5 ถ้าอยากได้คำตอบสั้น ให้กำหนดความยาวหรือรูปแบบไว้ใน prompt
ควรลด effort หรือเปลี่ยนไปใช้โมเดลที่ถูกกว่า
ลองลด effort ก่อน Anthropic รายงานว่าโมเดลรุ่นใหม่ที่ effort ต่ำมักทำได้เท่าโมเดลรุ่นเก่าที่ effort สูง และการใช้โมเดลเดียวก็ทำให้ prompt cache ยังใช้ได้ ค่อยเปลี่ยนไปใช้โมเดลที่ถูกกว่าเมื่อมันผ่านเทสต์ของคุณที่ระดับดีที่สุดของมันแล้ว
แชตบอตตอบลูกค้าควรตั้ง effort ระดับไหน
เริ่มที่ low แล้วค่อยขยับเป็น medium ถ้าเทสต์เจอว่าตอบตกหล่น งานแชตกับลูกค้ามักต้องการความเร็วและไม่ค่อยต้องใช้เหตุผลลึก Anthropic เองก็แนะนำระดับ low สำหรับงานแชตและงานปริมาณสูงที่ต้องการความเร็ว