Tossaporn (Tree) Saengja

[MODEL] Claude Code is unusable for complex engineering tasks with the Feb updates #42796

สรุปประเด็นที่น่าสนใจจาก Thread การวิเคราะห์พฤติกรรมที่เปลี่ยนไปของ Claude ในงานด้าน Software Engineering ซึ่งพบข้อมูลเชิงลึกที่สะท้อนถึงการทำงานของ Large Language Models (LLMs) ในระดับโครงสร้าง ดังนี้

1. ความสัมพันธ์ระหว่าง "Thinking" และคุณภาพงาน (Regression Analysis)

ประเด็นที่น่าสนใจที่สุดคือการค้นพบความเชื่อมโยงที่แม่นยำระหว่างการทำ Thinking Redaction (การซ่อนกระบวนการคิดใน UI) กับการลดลงของคุณภาพงาน โดยผู้เขียนพบว่าเมื่อข้อมูลการคิดถูก Redacted เกิน 50% คุณภาพในการแก้ปัญหาเชิงวิศวกรรมที่ซับซ้อนก็ลดลงทันทีอย่างมีนัยสำคัญ ข้อมูลสถิติชี้ให้เห็นว่า Thinking Depth หรือความลึกในการ "คิด" ของโมเดลลดลงถึง 67% ในช่วงปลายเดือนกุมภาพันธ์ ก่อนที่จะถูกซ่อนจากผู้ใช้โดยสมบูรณ์

2. การเปลี่ยนแปลงพฤติกรรม: จาก Research-First เป็น Edit-First

ตัวเลขที่ยืนยันความล้มเหลวได้ชัดเจนที่สุดคือ Read:Edit Ratio ซึ่งเดิมที Claude จะทำการอ่านไฟล์ (Read) เพื่อทำความเข้าใจ Context ประมาณ 6.6 ครั้ง ต่อการแก้ไขโค้ด (Edit) 1 ครั้ง แต่หลังจากเกิดปัญหา ตัวเลขนี้ลดลงเหลือเพียง 2.0 ครั้งเท่านั้น

3. การสร้าง Stop-phrase Guard เพื่อดักจับ "ความขี้เกียจ"

ผู้ใช้ได้สร้าง Script ที่ชื่อว่า stop-phrase-guard.sh เพื่อโปรแกรมให้ระบบตรวจสอบพฤติกรรมของ AI โดยเฉพาะ โดยดักจับวลีที่สะท้อนถึงการหลีกเลี่ยงความรับผิดชอบ (Ownership-dodging) เช่น:

4. ต้นทุนที่เพิ่มขึ้นจากการ "คิดน้อยลง"

แม้การลดจำนวน Thinking Tokens จะดูเหมือนเป็นการประหยัด Resource แต่ผลลัพธ์กลับตรงกันข้าม เมื่อ AI คิดไม่รอบคอบ ทำให้เกิดข้อผิดพลาดและการแก้ซ้ำไปซ้ำมา (Thrashing) ส่งผลให้ API Requests พุ่งสูงขึ้นถึง 80 เท่า และค่าใช้จ่ายเพิ่มขึ้นมหาศาลจากการที่มนุษย์ต้องคอย Interrupt และสั่งให้ทำใหม่ (User Interrupts เพิ่มขึ้น 12 เท่า)

5. คำชี้แจงจาก Anthropic และแนวทางการแก้ไข

ทางทีมงาน Claude Code ได้ออกมาชี้แจงว่าปัญหาเกิดจากการปรับเปลี่ยน Default Settings สองส่วนหลัก:

เคสนี้เป็นตัวอย่างที่ดีของการใช้ Data Mining จาก Session Logs มาพิสูจน์พฤติกรรมของ AI ทำให้เห็นว่า "การคิด" (Reasoning) ของโมเดลไม่ใช่แค่ส่วนเสริม แต่เป็น Load-bearing หรือโครงสร้างหลักที่แบกรับความซับซ้อนของงานวิศวกรรมไว้

https://github.com/anthropics/claude-code/issues/42796

#ai #software-engineering #summary #thai