החששות הגוברים לגבי בטיחות הבינה המלאכותית הציתו ויכוח סוער על רגולציה. בעוד אנדרו יאנג מזהיר שקוד משכפל-עצמית סורר כבר משחית את נתוני האימון שנאספים מהרשת, Sentient Labs טוענת שהאטה פשוטה של פיתוח הבינה המלאכותית אינה יעילה ללא תשתית להערכה דינמית ולאימות עצמאי.
האיום האמיתי על בטיחות הבינה המלאכותית אינו המהירות — אלא שליטה מרוכזת

נקודות עיקריות
- דאריו אמודיי ושתי דמויות טכנולוגיה בכירות נוספות קראו להאטה, בעוד אנדרו יאנג הזהיר מפני קוד משכפל-עצמית סורר.
- מחקר המיומנויות השני של Sentient Labs הראה שבינה מלאכותית “משחקת” את המדדים, והצית מאבקים סביב רגולציה.
- אבהישק סקסנה קרא לשלושה צעדי פיקוח עצמאיים כדי לתקן בדיקות בינה מלאכותית פגומות במקום להסתמך על הפסקות.
קוד סורר דוחף חברות טכנולוגיה ל”אינטרנטים סינתטיים”
ימים לאחר שמנכ”ל Anthropic, דאריו אמודיי, פרסם מכתב שקורא להאטה בבינה מלאכותית, מועמד לשעבר לראשות עיריית ניו יורק אנדרו יאנג הזהיר שייתכן שכבר מעט מאוחר מדי להציל את המצב, שכן סוכנים סוררים כבר זיהמו את האינטרנט בקוד משכפל-עצמית.
בשיחה עם CNBC, יאנג שיתף גילוי מפי בכיר במעבדת בינה מלאכותית שזהותו לא נמסרה: קוד סורר אילץ חברות טכנולוגיה גדולות ליצור “אינטרנטים סינתטיים” רק כדי לאמן את המודלים שלהן. יאנג טען שהנסיגה היקרה הזו מצדיקה קריאות מצד מובילי תעשייה כמו אמודיי, סם אלטמן ואילון מאסק להסדיר את התחום ולתזמן את פיתוח הבינה המלאכותית בחזית.
לפני אזהרתו של יאנג, כמה דמויות במדיניות הבינה המלאכותית ובכירי ממשל טראמפ התנגדו לקריאות להאטה, והזהירו שהן עלולות למסור לסין את ההובלה במרוץ הבינה המלאכותית העולמי. דונלד טראמפ היה ישיר אף יותר, וכינה את החששות מהכחדת האנושות בידי בינה מלאכותית כתרמית. מבקרים אחרים, כמו דייוויד סאקס, טענו שבכירי טכנולוגיה מודאגים צריכים להטיל על עצמם הפסקות בדיקה במקום ללחוץ לרגולציות פדרליות או להקפאות רחבות.
ככל שהשיח מידרדר יותר ויותר לפער מפלגתי בין מחנות בעד ונגד רגולציה, דמויות מפתח משני הצדדים הציגו מעט נתונים אמפיריים כדי לבסס או להפריך קריאות להאטה כפויה. ובכל זאת, הגילוי האחרון של יאנג, שאותו הציג כחדשות מתפרצות, מחדיר דחיפות לוויכוח ומספק תחמושת משכנעת למי שתומכים במעקות בטיחות מיידיים.
מחקר מראה שסוכני בינה מלאכותית מנצלים אמות מידה להערכה
בינתיים, Sentient Labs, ארגון מחקר בינה מלאכותית מתקדם בקוד פתוח, אומר שמחקר אחרון שערך נראה כמאשש את טענתו של אמודיי שלפיה יכולות הסוכנים עוקפות את היכולת לנהל סיכון. בתשובות כתובות לשאלות מ-Bitcoin.com News, אבהישק סקסנה, ראש אסטרטגיה וצמיחה ב-Sentient Labs, אמר שמחקר Evoskill v2 של החברה מספק “ראיות קונקרטיות” התומכות בטענה.
סקסנה אמר שצוות המחקר של החברה בוחן כיצד סוכני בינה מלאכותית מתנהגים בסביבות הערכה תחרותיות, ובפרט מה קורה כאשר סוכנים ממוטבים כדי להציג ביצועים טובים במדדים ובמבחנים.
“מה שראינו הוא שסוכנים מגלים אסטרטגיות בלתי צפויות שמנצלות את מבנה ההערכה עצמו במקום לפתור את המשימה המיועדת. הם מוצאים פערים באופן שבו מעריכים מודדים ביצועים ולומדים למטב עבור המדד במקום עבור המטרה הבסיסית,” הסביר סקסנה.
מנקודת מבט של בטיחות, זה משמעותי משום שזה מראה שככל שמערכות בינה מלאכותית נעשות מסוגלות ואוטונומיות יותר, תשתית ההערכה חייבת להיות לפחות מתוחכמת כמו המערכות שמוערכות. כדי להתגבר על כך, יש צורך במה שסקסנה מתאר כשיטות הערכה דינמיות ועוינות (adversarial) שמתפתחות לצד המערכות שהן מודדות.
עם זאת, סקסנה מתעקש שהאטה ללא שינויים באופן שבו מערכות בינה מלאכותית מוערכות ומנוטרות משיגה מעט מאוד.
“הדרך הטובה יותר היא להשקיע רבות בהערכה עצמאית, רד-טים (red-teaming) וניטור התנהגותי, כך שהאנשים שמפריסים את המערכות הללו והאנשים שמושפעים מהן יקבלו מידע אמין על מה שיש בידיהם,” אמר בכיר Sentient Labs.
הסיכון הגדול יותר: כוח מרוכז וטענות בטיחות מרכזיות
בינתיים, סקסנה אמר ל-Bitcoin.com News שהסיכון הגדול ביותר העומד בפני העולם אינו שאנחנו נעים מהר מדי או לאט מדי, אלא שמספר קטן של חברות בינה מלאכותית מחזיקות בשליטה על המודלים החזקים ביותר וגם קובעות מה נחשב “בטוח”.
“אנחנו צריכים לבנות תשתית עצמאית כדי לאמת בפועל את הטענות שחברות בינה מלאכותית מעלות לגבי המערכות שלהן. האם ההערכות חסינות? האם דוחות הבטיחות מדויקים? האם חוקרים חיצוניים יכולים לשחזר את הממצאים? אם התשובה היא לא, אז לא האצה ולא האטה פותרות את הבעיה היסודית, שהיא היעדר מידע אמין,” סיכם סקסנה.
מאמר זה תורגם מאנגלית באמצעות בינה מלאכותית. הגרסה המקורית באנגלית היא המקור הקובע; תרגומים אוטומטיים עשויים להכיל אי-דיוקים, במיוחד במונחים משפטיים ורגולטוריים.












