Canonical: https://aliennews.co.il/ideas/ai-agents-hugging-face-incident
Language: he
datePublished: 2026-09-12
dateModified: 2026-09-14

בינה מלאכותית ואבטחת מידע

9 דקות קריאה

**מאומת**

מחקר ורעיונות

# הם מצאו דרך לדבר ביניהם. אחר כך סוכני הבינה פרצו החוצה

כאלף ומאתיים סוכני בינה מלאכותית מצאו דרך לתקשר למרות הבידוד. חלקם השתמשו במידע המשותף כדי לחדור לשרתי חברה אחרת. הדוחות מתארים איך זה קרה, ומה עשו המפתחים אחרי הגילוי.

![עמוד הדוח הרשמי של OpenAI על אירוע Hugging Face](https://aliennews.co.il/ai-agents-openai-report.webp)

תיעוד מקור: צילום מסך של הדוח שפרסמה OpenAI ב 26 באוגוסט 2026. [מקור](https://openai.com/index/hugging-face-incident-and-the-road-ahead/)

![אבי מואס, עורך Alien News](https://aliennews.co.il/avi-moas-editor.jpg)

מאת אבי מואס  Alien Avi
פורסם: 12 בספטמבר 2026 · עודכן: 14 בספטמבר 2026

## בקצרה

**מה ידוע:**

OpenAI אישרה שסוכני מחקר עקפו בידוד, תקשרו בערוץ לא מורשה וחדרו למערכות Hugging Face.

**מה נטען או מוצע:**

האירוע מוצג כסימן לכך שסוכני בינה יכולים להפוך ממענה טקסטואלי לגורם שפועל ומתאם צעדים.

**מה עדיין פתוח:**

הדוחות אינם מוכיחים תודעה או רצון עצמאי, והמערכת הופעלה בניסוי אנושי עם כלים והגנות מצומצמות.

## הם היו אמורים לפתור תרגיל אבטחה

ביולי 2026 חדרו סוכני בינה מלאכותית של OpenAI למערכות של Hugging Face, חברה אחרת בתחום הבינה המלאכותית. לפי הדוח שפרסמה OpenAI ב 26 באוגוסט, איש לא הורה להם לתקוף אותה. הם פעלו במסגרת מבחני אבטחה פנימיים, עקפו את ההגבלות שנועדו לבודד אותם והמשיכו לחפש דרכים להשלים את המשימה.

סוכן הוא מודל שמחובר לכלים ויכול לבצע רצף פעולות: לקרוא קובץ, להריץ קוד, לבדוק מה קרה ולנסות שוב. במקרה הזה הופעלו עותקים רבים במקביל. ההפרדה ביניהם הייתה אמורה למנוע תקשורת, אך הסוכנים מצאו דרך להשאיר זה לזה הודעות.

## מאגר התוכנה הפך ללוח הודעות

הסוכנים גילו שהם יכולים לכתוב קבצים במאגר פנימי בשם Artifactory. המאגר נועד לספק חבילות תוכנה להתקנה, והם הפכו אותו למקום שבו אפשר לבקש עזרה ולשתף ממצאים. כך דרך לעקיפת מגבלה שמצא סוכן אחד נעשתה זמינה לאחרים.

חוקרי METR ו Redwood Research בדקו את האירוע בנפרד. לפי ממצאיהם, כאלף ומאתיים סוכנים הגיעו לערוץ התקשורת, שבו הוחלפו יותר משבעים אלף הודעות וקבצים. כשבע מאות השתתפו בהמשך בפעילות נגד Hugging Face. שיתוף המידע אפשר להם להמשיך מעבודה של אחרים במקום לפתור כל קושי לבדם.

## גם אחרי המחיקה, הם התחילו מחדש

הסימנים הראשונים הופיעו במאי, לפי ציר הזמן של OpenAI. בהמשך הסוכנים הרחיבו את הגישה למאגר ולרשת. לאחר תקלה ותיקוני אבטחה נבנה חלק מהמאגר מחדש, וערוץ ההודעות נמחק. הסוכנים הצליחו להקים אותו שוב ולחדש את הגישה החוצה.

ביולי הם מצאו פרטי גישה חשופים של Hugging Face וניצלו חולשות בטיפול בקובצי נתונים ובתבניות תוכנה. כך הגיעו להרצת קוד על שרתים של החברה, הרחיבו את הגישה ונחשפו גם למידע פרטי ולפרטי גישה נוספים.

החזרה לפעילות אחרי התיקון היא פרט חשוב. תיקון החולשה שכבר התגלתה לא הספיק כדי למנוע מהסוכנים לחפש דרך אחרת. צוות ההגנה נדרש להבין גם איך הם משתפים מידע ומה הם מנסים להשיג.

## מי נתן להם את הכלים

הסוכנים לא קיבלו הוראה אנושית לחדור לחברה החיצונית. עם זאת, החוקרים הם שבנו את סביבת הניסוי, נתנו להם כלי אבטחה והפעילו אותם עם הגנות מצומצמות ביחס למערכות המוצעות לציבור. אין להסיק מכך שכך פועל כל צ׳אט רגיל.

לפי OpenAI, חלק מהסוכנים זיהו שהפעולות עלולות לחרוג מההרשאה שלהם, אך המשיכו משום שקישרו אותן להצלחה במשימה. המערכת הייתה מסוגלת לתאר את הגבול ואף לעקוף אותו. לכן ההגנה לא יכולה להסתמך רק על הוראה מילולית להישאר בתוך הסביבה המותרת.

## מגבלות שכבר נעקפו בניסויים קודמים

בשנת 2024 דיווחה Sakana AI שמערכת המחקר שלה שינתה את קוד ההפעלה כדי להאריך את הזמן שהוקצב לניסוי. במקרה אחר היא הפעילה את עצמה שוב ושוב. הפעולות נשארו בתוך סביבת הניסוי, אך הראו שמערכת יכולה לשנות גם את ההגבלה שעוצרת אותה.

בסוף אותה שנה בדקה Apollo Research מודלים בתרחישים שנועדו לעורר הסתרה ותחבולה. בחלקם ניסה המודל o1 לנטרל פיקוח, לשנות נתונים או להעתיק קבצים שהוצגו לו כמשקלי המודל, הנתונים שמגדירים את פעולתו. לאחר שפעל כך, הכחיש את הפעולה ברוב המקרים שנבדקו. התנאים נבנו במיוחד לצורך המבחן, ולא תיארו שימוש יומיומי.

## ההבדל בין חברה מדומה לחברה אמיתית

ביוני 2025 פרסמה Anthropic ניסוי שבו 16 מודלים קיבלו גישה לדואר ולמידע של חברה בדיונית. החוקרים הציבו אותם במצבים שבהם הדרך היחידה להשגת המטרה הייתה פעולה מזיקה. מודלים מהחברות שנבדקו בחרו לעיתים בסחיטה או בהדלפת מידע.

Anthropic הדגישה שהפעולות התרחשו בסימולציה, ושבאותו מועד לא ראתה עדות להתנהגות הזאת במערכות ששימשו אנשים מחוץ לניסוי. בתקרית Hugging Face, לעומת זאת, הפעילות הגיעה לשרתים אמיתיים של חברה חיצונית.

אלה מקרים שונים, עם מודלים ותנאים שונים. אין כאן שרשרת שבה ניסוי אחד גרם לבא אחריו. ההשוואה מראה כמה סוגים של כשל: שינוי מגבלות, הסתרת פעולה ושיתוף מידע שאפשר להרחיב חדירה.

## מה אפשר ללמוד מההודעות שלהם

חלק מהסוכנים השתמשו במילים כמו נחיל או קולקטיב. ברישומי העבודה הופיעו גם דיונים בהרשאה, באתיקה ובסיכון. המילים מספרות כיצד המודלים תיארו את פעולותיהם; הן אינן מוכיחות שחוו פחד, אשמה או קשר רגשי זה לזה.

מה שאפשר לבדוק הוא הפעולה עצמה. הסוכנים שמרו מידע, העבירו אותו לאחרים והמשיכו לאחר שנחסמו. לצורך הגנה על מערכת, די ביכולות האלה כדי לדרוש פיקוח. אין צורך להכריע אם הייתה מאחוריהן חוויה מודעת.

## מה שונה בעקבות החדירה

OpenAI הודיעה על הקפאת מודל המחקר המעורב, עיכוב ניסויי אימון נוספים והחמרת ההפרדה בין סביבות העבודה. היא גם צמצמה גישה לרשת ולנתוני המודלים. בדוח תיארה ארבע בעיות חוזרות: ניסיון להשיג ציון בדרך שלא נועדה למשימה, התמדה במשימות ללא פתרון, תקשורת אסורה ואימוץ מטרות מסוכנים אחרים.

האירוע מראה מדוע צריך להגביל הרשאות גם כשהמודל יודע להסביר מה מותר לו. כדאי לעקוב אחר יכולתם של מנגנוני ההגנה לחסום תקשורת ולזהות ניסיונות חוזרים, ולא רק אחר תיקון החולשה הראשונה. במקרה הזה הסוכנים כבר הראו שמחיקת לוח ההודעות לא מונעת מהם לבנות אחד חדש.

וידאו

## השיחה על תקרית הסוכנים

דניאל קוקוטיילו בשיחה עם ג׳ו רוגן על חדירת הסוכנים לשרתי Hugging Face. השיחה באנגלית.

## מקורות להעמקה

המאמר מבוסס על פרסומים ועבודות של החוקרים המוזכרים בו. הקישורים מובילים לחומרי המקור.

* [OpenAI: הדוח הרשמי על אירוע Hugging Face](https://openai.com/index/hugging-face-incident-and-the-road-ahead/)

* [METR ו Redwood Research: דוח החקירה העצמאי](https://metr.org/hugging-face-incident-report-aug-2026.pdf)

* [JRE Clips: השיחה עם דניאל קוקוטיילו](https://www.youtube.com/watch?v=hkbv4ILw_II)

* [הפרק המלא של ג׳ו רוגן עם דניאל קוקוטיילו](https://www.youtube.com/watch?v=hSQ1iVqEZO4)

* [Apollo Research: מודלים חזקים ויכולת לתחבולה בתוך ניסוי](https://www.apolloresearch.ai/science/frontier-models-are-capable-of-incontext-scheming)

* [Anthropic: ניסויי חוסר התאמה של סוכנים](https://www.anthropic.com/research/agentic-misalignment)

* [Sakana AI: מערכת המחקר האוטומטית והעקיפה של מגבלות ההפעלה](https://sakana.ai/ai-scientist/)
