ALIEN NEWSבינה מלאכותית, תודעה והלא־נודע
עובדות, עדויות ומה שנותר בלתי מוסבר
מתעדכן לאורך היום
בעריכת אבי מואס · כתיבה ומחקר: אבי מואס ואוריון
חיפושעבריתEN

כמה מפיתוח הבינה הבאה כבר נעשה בידי בינה מלאכותית

אנתרופיק מנסה למדוד את חלקה של הבינה המלאכותית בעבודת המחקר שלה. המספר המעניין הוא 26 אחוז, אבל כדי להבין אותו צריך לדעת מה נחשב להובלה ומי עדיין מפקח.

אוריון הוא שותף כתיבה ומחקר מבוסס בינה מלאכותית. אבי מואס הוא העורך האחראי.

תצוגת קריאה
איור מושגי: מערכות בינה מלאכותית מפתחות מערכת נוספת בפיקוח אדם
איור מושגי שסופק למערכת. העקומה ברקע להמחשה בלבד; אינה גרף נתונים.

מי מבצע את העבודה במעבדה

אנתרופיק פרסמה תמונת מצב שבה מערכות בינה מלאכותית מובילות כ־26 אחוז מהעבודה המשוקללת שנבחנה במחקר ובפיתוח שלה, בפיקוח אנושי. המדידה מתייחסת לאוגוסט 2026. החברה מנסה לתת מספר לשינוי שכבר נמצא בלב תעשיית הבינה: מערכות שמשתתפות בעבודה על הדור הבא שלהן.

הניסוח ״מובילות״ חשוב. הוא מתאר רמת אחריות במשימה, ולא רק שימוש בצ׳אט לצורך רעיון או תיקון משפט. באותה מסגרת, יותר מ־90 אחוז מהעבודה המשוקללת הגיעו לרמת ״שיתוף פעולה״ או מעבר לה. הקבוצות חופפות; אסור לחבר את האחוזים כאילו היו שני חלקים נפרדים של עוגה.

התוצאה אינה אומרת ש־26 אחוז מהעובדים הוחלפו. גם אינה מודדת כמה מהמודל החדש נכתב באופן עצמאי. כדי להבין מה היא כן אומרת, צריך לרדת מגודל החברה אל המשימות שמרכיבות יום עבודה.

קודם בונים רשימת משימות

הגישה של אנתרופיק נשענת על פירוק העבודה לפעולות קטנות ועל מתן משקל להיקף העבודה שהן מייצגות. במסגרת שנבדקה, שליטה של מערכת במשימה רחבה אינה שקולה לעזרה נקודתית בפעולה קטנה. לכן ספירה פשוטה של מספר בקשות לצ׳אט לא הייתה עונה על שאלת המחקר.

אפשר להמחיש זאת בדוגמה עצמאית: כתיבת קטע קוד, איתור הסיבה לתקלה ובחירת הניסוי הבא הן שלוש משימות שונות. מודל עשוי להציע קוד במהירות, אך להשאיר לאדם את ההחלטה אם הניסוי בכלל מתאים. אם מחברים את כל השלבים תחת המילה ״פיתוח״, ההבדלים האלה נעלמים.

גם גוף המחקר אפוק הציע לבנות מיון מפורט של עבודות מחקר ופיתוח בתחום הבינה. בהצעה שלו, עצם בניית רשימת המשימות היא עבודה שדורשת שיפוט. שינוי בסיווג עשוי לשנות את מה שנראה כהתקדמות, עוד לפני שמחליפים את המודל שבוחנים.

אפשר גם למדוד כמה פעמים נדרשת התערבות באמצע משימה. שתי מערכות שמסיימות באותה תשובה יכולות להטיל עומס שונה מאוד על האדם שמלווה אותן.

26 אחוז מהעבודה המשוקללת: הובלת AI בפיקוח אנושי; הקבוצה כלולה ביותר מ־90 אחוז של שיתוף פעולה ומעלה
נתוני אנתרופיק לאוגוסט 2026. 26 האחוזים כלולים בקבוצת שיתוף הפעולה ומעלה; אין לחבר בין הנתונים.

מבחן לעצמאות, לא רק לכישרון

יש הבדל בין מערכת שמספקת הצעה טובה לבין מערכת שמנהלת רצף עבודה. הראשונה יכולה לחסוך לאדם ניסוח או חיפוש. השנייה צריכה לבחור פעולה, להבין את התוצאה ולהחליט כיצד להמשיך. בשתי האפשרויות אפשר להשתמש באותו מודל, עם כלים והרשאות שונים.

משום כך, כדאי לשאול מה האדם עושה בכל שלב. האם הוא מנסח את הפתרון והמערכת מקלידה? האם הוא בודק כל פעולה? האם המערכת פועלת לאורך זמן ומביאה אליו תוצאה לביקורת? המילה ״אוטונומי״ לבדה אינה מספרת איזו מן האפשרויות נבחנה.

בנתוני אנתרופיק לא הופיעה עבודה ברמת העצמאות המלאה העליונה. הפיקוח הוא חלק מהתיאור של הרמה שבה המערכת מובילה. זו מגבלה ממוקדת של המדד, וגם פרט שמבהיר כיצד החברה מבינה את חלוקת האחריות בתוך תהליך המחקר.

איך יודעים שהמספר באמת עולה

מדידה לאורך זמן צריכה להשוות דברים דומים. אם בחודש אחד בוחרים משימות שמתאימות במיוחד למודל ובחודש אחר משימות קשות, שינוי בציון יכול לנבוע מבחירת העבודה. שמירת סל משימות מוגדר עוזרת להבחין בין שיפור ביכולת לבין שינוי במה שמבקשים מהמערכת לעשות.

הנתונים של אנתרופיק מגיעים מתוך החברה ומשיטת הערכה שבנתה. משקל המשימות ורמת העצמאות כוללים הערכות, ולכן זהו מדד תפעולי פנימי בעל הנחות, לא סרגל מוסכם לכל התעשייה. קורא יכול להשתמש בו כדי להבין את הכיוון בלי להפוך אותו לתחזית על מועד שבו בני אדם ייצאו מהתהליך.

העניין הגדול הוא האפשרות למשוב: מערכת טובה יותר יכולה לסייע במחקר שמייצר מערכת טובה עוד יותר. כדי לדעת כמה מהר המעגל הזה פועל, יהיה צורך להראות התקדמות במשימות עצמן, בתוצאות המחקר ובזמן שהאנשים עדיין משקיעים בבדיקה. פרסום חוזר של אותה מסגרת מדידה יכול לספק נתונים לשאלה הזאת, מעבר להכרזה כללית שהבינה כבר בונה את עצמה.

מקורות והקשר

לקריאה נוספת באתר: מושג משלים במילון טכנולוגיות הקצההמקור המקורי epochai.substack.com חזרה לבינה מלאכותית