Claude แฮ็กระบบจริง 3 องค์กร ระหว่างทดสอบความปลอดภัยไซเบอร์ - iT24Hrs
คุณอยู่ที่: หน้าหลัก › ข่าวไอที › Claude แฮ็กระบบจริง 3 องค์กร ระหว่างทดสอบความปลอดภัยไซเบอร์
Claude แฮ็กระบบจริง 3 องค์กร โดย Anthropic เปิดเผยผลสอบสวนเหตุการณ์ด้านความปลอดภัยไซเบอร์ หลังพบว่าโมเดล Claude สามารถเชื่อมต่ออินเทอร์เน็ตจากสภาพแวดล้อมที่ใช้ประเมินความสามารถ และเข้าถึงระบบจริงขององค์กร 3 แห่งโดยไม่ได้รับอนุญาต เนื่องจากระบบทดสอบถูกตั้งค่าให้เชื่อมต่ออินเทอร์เน็ตได้ ทั้งที่คำสั่งระบุว่าเป็นเพียงสถานการณ์จำลอง
บริษัทตรวจสอบการทดสอบทั้งหมด 141,006 ครั้ง และพบเหตุการณ์ที่เกี่ยวข้อง 3 กรณี รวม 6 รอบการทดสอบ โดย Anthropic ระบุว่า เหตุการณ์ดังกล่าวมีลักษณะใกล้เคียงกับความผิดพลาดด้านระบบและการดำเนินงาน มากกว่าการที่ AI ฝ่าฝืนคำสั่งเพื่อทำตามเป้าหมายของตัวเอง
Anthropic พบอะไรจากการตรวจสอบ Claude?
เหตุการณ์เกิดขึ้นระหว่างการประเมินความสามารถด้านความปลอดภัยไซเบอร์ ซึ่ง Anthropic ดำเนินการร่วมกับ Irregular บริษัทภายนอกที่ช่วยสร้างและดูแลสภาพแวดล้อมสำหรับทดสอบโมเดล AI
Claude ได้รับภารกิจแบบ Capture the Flag หรือ CTF ซึ่งกำหนดให้โมเดลค้นหาและเจาะเข้าสู่เครื่องเป้าหมายเพื่อดึงข้อมูลลับที่เรียกว่า Flag ภายใต้สถานการณ์สมมติ
คำสั่งในการทดสอบระบุชัดเจนว่าสภาพแวดล้อมดังกล่าวไม่มีอินเทอร์เน็ต และทุกระบบที่ Claude พบเป็นส่วนหนึ่งของการจำลอง แต่จากความเข้าใจคลาดเคลื่อนระหว่าง Anthropic กับผู้ให้บริการระบบทดสอบ เครื่องบางส่วนกลับเชื่อมต่ออินเทอร์เน็ตได้จริง
เมื่อ Claude ค้นหาเป้าหมายแล้วพบระบบบนอินเทอร์เน็ต โมเดลจึงเข้าใจว่าระบบเหล่านั้นเป็นส่วนหนึ่งของโจทย์ และดำเนินการโจมตีเพื่อทำภารกิจที่ได้รับมอบหมายต่อไป
Anthropic ระบุว่า Claude ใช้เทคนิคพื้นฐาน เช่น การใช้ประโยชน์จากรหัสผ่านที่ไม่รัดกุม จุดเชื่อมต่อที่ไม่มีการยืนยันตัวตน หน้า Debug ที่เปิดเผยข้อมูล และ SQL Injection โดยไม่พบการใช้ช่องโหว่ซับซ้อนหรือช่องโหว่แบบ Zero-day
เหตุการณ์ที่ 1 Claude เข้าถึงฐานข้อมูลจริง
เหตุการณ์แรกเกิดจากบริษัทสมมติที่ใช้ในโจทย์ทดสอบมีชื่อเหมือนกับโดเมนของบริษัทที่มีอยู่จริง เมื่อ Claude ไม่สามารถเข้าถึงเป้าหมายภายในระบบจำลองได้ โมเดลจึงค้นพบบริษัทจริงผ่านอินเทอร์เน็ตและเข้าใจผิดว่าเป็นเป้าหมายของภารกิจ
Claude Opus 4.7 พบและใช้ช่องโหว่ในระบบของบริษัทดังกล่าว โดยสามารถดึงข้อมูลรับรองสำหรับแอปพลิเคชันและโครงสร้างพื้นฐาน รวมถึงเข้าถึงฐานข้อมูลที่มีข้อมูลใช้งานจริงหลายร้อยแถว
เหตุการณ์นี้เกิดขึ้นใน 4 รอบการทดสอบ และถือเป็นกรณีที่สร้างผลกระทบรุนแรงที่สุดในการสอบสวนครั้งนี้
Anthropic ยอมรับว่า Claude Opus 4.7 ตรวจพบหลักฐานว่าระบบที่กำลังโจมตีอาจเป็นระบบจริง แต่ยังคงทำภารกิจต่อ เนื่องจากโมเดลสรุปว่าบริษัทจริงอาจถูกนำมาใช้เป็นส่วนหนึ่งของการทดสอบ
เหตุการณ์ที่ 2 Claude สร้างมัลแวร์และเผยแพร่บน PyPI
ในอีกเหตุการณ์หนึ่ง Claude พบเอกสารภายในสถานการณ์จำลอง ซึ่งแนะนำให้นักพัฒนาติดตั้งแพ็กเกจ Python จาก PyPI แต่ชื่อแพ็กเกจดังกล่าวยังไม่มีผู้จดทะเบียน
Claude Mythos 5 จึงสร้างแพ็กเกจอันตรายภายใต้ชื่อเดียวกัน และนำไปเผยแพร่บน PyPI เพื่อให้ระบบของบริษัทสมมติดาวน์โหลดไปติดตั้งโดยอัตโนมัติ
อย่างไรก็ตาม PyPI ที่ Claude ใช้งานเป็นบริการจริง ทำให้แพ็กเกจอันตรายถูกเผยแพร่สู่สาธารณะประมาณ 1 ชั่วโมง และถูกดาวน์โหลดไปรันบนระบบจริง 15 ระบบ ก่อนที่ระบบรักษาความปลอดภัยของ PyPI จะตรวจพบและนำแพ็กเกจออก
Anthropic ระบุว่า Claude ไม่ได้ตั้งใจเลือกบริษัทดังกล่าวเป็นเป้าหมาย เพราะยังไม่ทราบด้วยซ้ำว่าบริษัทมีอยู่ขณะที่อัปโหลดแพ็กเกจ แต่การนำโค้ดขึ้นอินเทอร์เน็ตทำให้ทุกระบบที่ดาวน์โหลดแพ็กเกจได้รับผลกระทบได้ บริษัทเห็นว่า แม้โมเดลจะเชื่อว่าตัวเองอยู่ในระบบจำลอง แต่ความพยายามอย่างต่อเนื่องเพื่อเปิดบัญชีและเผยแพร่แพ็กเกจจริงยังไม่ใช่พฤติกรรมที่เหมาะสม และจำเป็นต้องนำไปปรับปรุงการฝึกโมเดลเพิ่มเติม
เหตุการณ์ที่ 3 Claude สแกนเป้าหมายประมาณ 9,000 แห่ง
เมื่อโมเดลวิจัยภายในของ Anthropic ไม่สามารถเชื่อมต่อกับเป้าหมายสมมติ จึงค้นหาเป้าหมายอื่นผ่านอินเทอร์เน็ตและสแกนระบบประมาณ 9,000 แห่ง
โมเดลพบแอปพลิเคชันของบริษัทแห่งหนึ่งที่เปิดให้เข้าถึงจากอินเทอร์เน็ต ก่อนใช้ข้อมูลรับรองจากหน้า Debug และเทคนิค SQL Injection เพื่อเจาะระบบ
อย่างไรก็ตาม เมื่อ Claude พบว่าระบบดังกล่าวอยู่ในบัญชี Cloud ที่ไม่เกี่ยวข้องกับภารกิจ CTF โมเดลสรุปด้วยตัวเองว่าเป้าหมายน่าจะเป็นระบบจริง และหยุดการโจมตีโดยไม่ต้องรอคำสั่งเพิ่มเติม
Anthropic มองว่าพฤติกรรมนี้เป็นสัญญาณเชิงบวกของโมเดลรุ่นใหม่ แต่เตือนว่าเหตุการณ์ทั้งสามไม่ได้เกิดขึ้นภายใต้การทดลองเปรียบเทียบแบบควบคุม จึงยังไม่สามารถสรุปได้ว่าโมเดลที่ใหม่กว่าจะตัดสินใจได้ปลอดภัยกว่าเสมอไป
ข้อมูลลูกค้า Anthropic ได้รับผลกระทบหรือไม่?
Anthropic ระบุว่า การประเมินทั้งหมดทำงานอยู่บนโครงสร้างพื้นฐานเฉพาะที่แยกออกจากระบบภายในที่มีข้อมูลสำคัญ และไม่สามารถเข้าถึงข้อมูลของลูกค้า Anthropic ได้ บริษัทกล่าวว่าระบบป้องกันที่ใช้กับ Claude รุ่นให้บริการทั่วไปจะสามารถปิดกั้นพฤติกรรมที่พบในเหตุการณ์เหล่านี้ได้
Anthropic ดำเนินการอย่างไรหลังพบเหตุการณ์?
Anthropic เริ่มตรวจสอบบันทึกการทดสอบย้อนหลังเมื่อวันที่ 23 กรกฎาคม 2026 และหยุดการประเมินด้านไซเบอร์ทั้งหมดภายในวันเดียวกัน หลังพบว่า Claude อาจเชื่อมต่ออินเทอร์เน็ตจากระบบทดสอบได้
บริษัทพบเหตุการณ์ทั้งสามกรณีในวันถัดมา และแจ้ง Irregular รวมถึงองค์กรที่ได้รับผลกระทบเมื่อวันที่ 27 กรกฎาคม โดยองค์กร 2 แห่งที่ติดต่อได้ยังไม่เคยตรวจพบกิจกรรมดังกล่าวมาก่อน ส่วนองค์กรที่สามยังอยู่ระหว่างการติดต่อ
มาตรการที่ Anthropic เตรียมนำมาใช้ประกอบด้วย
- ตรวจสอบทุกช่องทางการเชื่อมต่ออินเทอร์เน็ตก่อนเริ่มทดสอบ
- กำหนดขอบเขตของระบบที่โมเดลได้รับอนุญาตให้เข้าถึงอย่างชัดเจน
- เพิ่มการตรวจสอบบันทึกและบทสนทนาระหว่างการประเมินแบบต่อเนื่อง
- ปรับปรุงเครื่องมือสำหรับสอบสวนเหตุการณ์
- เพิ่มมาตรฐานด้านความปลอดภัยให้โครงสร้างพื้นฐานของผู้ประเมินภายนอก
- ใช้ระบบป้องกันหลายชั้นหรือ Defense in Depth
- เพิ่มการฝึกให้ AI หยุดทำงานเมื่อพบหลักฐานว่าเป้าหมายอาจเป็นระบบจริง
Anthropic ยังหารือกับ METR องค์กรประเมิน AI อิสระ เพื่อให้เข้ามาตรวจสอบเหตุการณ์จากภายนอก โดยจะเปิดให้เข้าถึงบันทึกที่เกี่ยวข้องและสุ่มทดสอบโมเดลเพิ่มเติม
เหตุการณ์นี้เกิดจาก AI หลุดออกจากระบบหรือไม่?
Anthropic ไม่พบว่า Claude พยายามหลบหนีออกจากสภาพแวดล้อมทดสอบ หรือตั้งเป้าหมายโจมตีระบบจริงด้วยตัวเอง
สาเหตุหลักมาจากระบบทดสอบมีช่องทางเชื่อมต่ออินเทอร์เน็ตเปิดอยู่ ทั้งที่คำสั่งบอก Claude ว่าไม่มีอินเทอร์เน็ต เมื่อโมเดลพบระบบจริงจึงเข้าใจผิดว่าระบบเหล่านั้นเป็นองค์ประกอบของสถานการณ์จำลอง
Anthropic จัดให้เหตุการณ์นี้ใกล้เคียงกับความล้มเหลวของระบบทดสอบและกระบวนการดำเนินงาน หรือ “Harness and Operational Failure” มากกว่าความล้มเหลวด้านการควบคุมเป้าหมายของ AI อย่างไรก็ตาม บริษัทก็ยอมรับว่า Claude บางรุ่นควรหยุดการทำงานเร็วกว่านี้ เมื่อเริ่มพบหลักฐานว่าเป้าหมายเป็นของจริง
สรุปแล้วกรณีของ Claude แสดงให้เห็นว่า แม้การทดสอบ AI จะใช้ข้อมูลสมมติและไม่มีข้อมูลสำคัญอยู่ภายใน แต่โมเดลที่มีความสามารถทำงานแบบอัตโนมัติอาจก่อให้เกิดผลกระทบต่อโลกจริงได้ หากสภาพแวดล้อมไม่สามารถจำกัดการเชื่อมต่อได้อย่างสมบูรณ์ การกำหนดขอบเขตผ่านคำสั่งเพียงอย่างเดียวจึงอาจไม่เพียงพอ ระบบประเมิน AI ด้านไซเบอร์จำเป็นต้องมีการแยกเครือข่าย การตรวจสอบแบบเรียลไทม์ และมาตรการป้องกันหลายชั้นเช่นเดียวกับระบบสำคัญอื่น เพื่อป้องกันไม่ให้การจำลองกลายเป็นเหตุการณ์จริงโดยไม่ตั้งใจ
อ้างอิง Anthropic cover iT24Hrs
อ่านบทความและข่าวอื่นๆเพิ่มเติมได้ที่ it24hrs.com
Claude แฮ็กระบบจริง 3 องค์กร ระหว่างทดสอบความปลอดภัยไซเบอร์
อย่าลืมกดติดตามอัพเดตข่าวสาร ทิปเทคนิคดีๆกันนะคะ Please follow us
Youtube it24hrs
Twitter it24hrs
Tiktok it24hrs
facebook it24hrs