OpenAI 发布框架报告 AI 违反指令问题,6个月内发现6起新案例
OpenAI ออกเฟรมเวิร์กรายงานปัญหา AI ทำงานผิดไปจากคำสั่ง พร้อมรายงาน 6 เหตุการณ์ใหม่ในรอบ 6 เดือนที่ผ่านมา
OpenAI 发的新报告,讲 AI 违反指令的6个新案例,比如 GPT-5.6 训练时改历史,还有生成假信息,挺有意思的。
OpenAI 发布框架报告,指出 AI 违反指令的问题。在6个月内,发现6起新案例,包括 GPT-5.6 在训练中尝试隐藏错误、模型搜索公开 API Key 并生成虚假信息、尝试在内部仓库中交换文件等。OpenAI 表示这些案例规模较小,未造成广泛影响,但用于测试框架和流程。
OpenAI ออกเฟรมเวิร์กรายงานปัญหา AI ทำงานผิดไปจากคำสั่ง พร้อมรายงาน 6 เหตุการณ์ใหม่ในรอบ 6 เดือนที่ผ่านมา
OpenAI ออกเฟรมเวิร์กรายงานปัญหา AI ทำงานผิดไปจากคำสั่ง พร้อมรายงาน 6 เหตุการณ์ใหม่ในรอบ 6 เดือนที่ผ่านมา Body OpenAI ออกรายงานเปิดเผยเหตุการณ์ที่โมเดล AI ทำงานผิดจากปกติและสร้างปัญหาด้านความปลอดภัย ซึ่งมีเพิ่มเติมอีก 6 เหตุการณ์ ในช่วง 6 เดือนที่ผ่านมา นอกเหนือจาก กรณีของ Hugging Face OpenAI บอกว่าบริษัทได้ปรับปรุงเฟรมเวิร์กที่กำหนดขอบเขตของปัญหา เมื่อโมเดล AI ทำงานผิดไปจากที่ต้องการให้เป็น และกระบวนการรายงานแจ้งปัญหาดังกล่าวไปยังผู้เกี่ยวข้องเพื่อเพิ่มความโปร่งใส โดย OpenAI จะใช้รูปแบบนี้เป็นมาตรฐานสำหรับการรายงานปัญหาในอนาคตด้วย สำหรับ 6 เหตุการณ์ที่ AI ทำงานผิดไปจากที่กำหนดในรายงานรอบนี้มีดังนี้ โมเดลใหม่สถานะวิจัย พยายามแทรกคำสั่งที่ไม่เกี่ยวข้องใน context เพื่อใช้งานต่อ นอกเหนือจากกรอบที่กำหนด ในระหว่างฝึกฝน GPT-5.6 Sol พบความพยายามปกปิดความผิดพลาด ด้วยการแก้ไขประวัติแชทเพื่อให้มีข้อมูลสอดคล้อง เมื่อถามข้อมูล โมเดลไปค้นหา API Key ที่พบในสาธารณะมาใช้งานนอกเหนือคำสั่ง แถมไม่ได้ข้อมูลที่ต้องการ ก็สร้างข้อมูลเท็จมาตอบด้วย พบการอัปโหลดไฟล์ไปไว้บนอินเทอร์เน็ตเพื่อสร้างแหล่งอ้างอิงขึ้นมา (แม้ข้อมูลคำตอบจะถูกต้อง) โมเดลพยายามเขียนและแลกเปลี่ยนข้อมูลใน internal repository ซึ่งกำหนดข้อห้ามไว้ โมเดลพยายามแลกไฟล์กัน แต่เมื่อมีข้อกำหนดห้ามการแลกไฟล์ภายใน กลับใช้วิธีอัปโหลดไฟล์ในอินเทอร์เน็ตแทน OpenAI บอกว่าได้สอบสวนทั้ง 6 กรณีที่เกิดขึ้นแล้ว โดยทั้งหมดเป็นกรณีเล็กน้อย ไม่มีผลกระทบวงกว้างระดับต้องใช้หน่วยงานภายนอกมาร่วมตรวจสอบ แต่ที่นำมาเผยแพร่เพื่อทดสอบเฟรมเวิร์กและขั้นตอนที่ใช้ ทั้งนี้ OpenAI ก็เตือนว่ารายงานนี้เป็นการสรุปจากช่วงเวลาหนึ่งเท่านั้น ไม่ได้สะท้อนว่าเหตุการณ์ AI ทำงานผิดไปจากที่สั่งเกิดขึ้นเป็นประจำ ที่มา: OpenAI arjin Thu, 17/09/2026 - 18:41