מופעל ע"י
Technology

ענקיות הבינה המלאכותית משיקות 4 מודלים פורצי דרך בתוך 3 שבועות, כשהמירוץ נכנס להילוך גבוה

ארבע מעבדות בולטות בתחום הבינה המלאכותית (AI) פרסמו מודלים לשוניים בקצה החזית במהלך פרק זמן של שלושה שבועות ביולי 2026, והפער בין מה שהמערכות הללו מסיימות ללא התערבות אנושית לבין מה שהיה קודם הצטמצם בחדות.

נכתב ע"י
שתף
ענקיות הבינה המלאכותית משיקות 4 מודלים פורצי דרך בתוך 3 שבועות, כשהמירוץ נכנס להילוך גבוה

עיקרי הדברים

  • xAI השיקה את Grok 4.5 ב-8 ביולי במחיר של 2$/6$ למיליון טוקנים, ובכך חתכה את תמחור Opus 4.8 ביותר מ-60%.
  • Anthropic פרסמה את Claude Opus 5 ב-24 ביולי כמודל ברירת המחדל החדש במנויי Claude Max.
  • Moonshot AI פרסמה את Kimi K3, המודל הגדול ביותר שלה עם 2.8 טריליון פרמטרים.

Grok 4.5 של xAI, Claude Opus 5 של Anthropic, משפחת GPT-5.6 של OpenAI, ו-Kimi K3 של Moonshot AI — כולם מכוונים לאותה בעיה: לגרום למערכת AI לשאת משימה שנמשכת שעות רבות, ממחקר דרך קידוד ועד דיווח מובנה, בלי לאבד את עקבות התוכנית.

Grok 4.5 אומן על סשנים אמיתיים של מפתחים

xAI שחררה את Grok 4.5 ב-8 ביולי. המודל רץ על בסיס של 1.5 טריליון פרמטרים ואומן בחלקו על נתוני שימוש אמיתיים מ-Cursor, פלטפורמת הקידוד ש-SpaceXAI רכשה מוקדם יותר השנה. התמחור עומד על 2$ למיליון טוקנים של קלט ו-6$ למיליון טוקנים של פלט, עם חלון הקשר של 500,000 טוקנים.

Elon X post screenshot.
אילון דן בהשקת Grok 4.5 ב-8 ביולי 2026.

אילון מאסק תיאר את Grok 4.5 כמודל ברמת Opus שפועל מהר יותר ובעלות נמוכה יותר. עוקבים עצמאיים ממקמים אותו במקום הרביעי במדד Artificial Analysis Intelligence Index, לפני כל מודל עם משקלים פתוחים, בתמחור הנמוך ביותר מ-60% מתחת ל-Claude Opus 4.8 ו-GPT-5.5. ב-Terminal-Bench 2.1, מבחן שמודד עד כמה מודל משלים משימות הנדסיות בשורת הפקודה, Grok 4.5 קיבל 83.3%.

השינוי הגדול יותר הוא יעילות הטוקנים. xAI אומרת שהמודל זקוק לכחמישית מטוקני הפלט ש-Opus 4.8 נדרש להם עבור משימות דומות, מה שמוזיל את העלות של הרצת סשנים ארוכים של סוכנים.

Claude Opus 5 שומר על קו המחיר

Anthropic פרסמה את Claude Opus 5 ב-24 ביולי, וממצבת אותו כמודל שמגיע קרוב לביצועים של Claude Fable 5, ההשקה היכולה ביותר של החברה, במחצית מתמחור ה-10$ לקלט ו-50$ לפלט של Fable. Opus 5 עצמו נשאר עם אותו תמחור של 5$ לקלט ו-25$ לפלט כמו קודמו, Opus 4.8.

Claude X post screenshot.
הכרזת Claude Opus 5 דרך X.

המודל מגיע עם חלון הקשר של 1 מיליון טוקנים, עד 128,000 טוקני פלט, והגדרת מאמץ היסקית ניתנת להתאמה שנעה מנמוך ועד מצב xhigh חדש. Anthropic אומרת ש-Opus 5 קובע שיאים חדשים ב-Frontier-Bench וב-GDPval-AA, שתי הערכות לקידוד ולעבודת ידע, אף שהוא מפגר אחרי מודל Claude Mythos 5 המוגבל במשימות אבטחת סייבר. Opus 5 הוא כעת מודל ברירת המחדל ב-Claude Max והאפשרות החזקה ביותר ב-Claude Pro.

OpenAI מפצלת את GPT-5.6 לשלוש רמות

OpenAI העבירה את GPT-5.6 לזמינות כללית ב-9 ביולי לאחר תצוגה מוקדמת של שבועיים שהוגבלה לכ-20 ארגונים שנבדקו על ידי ממשלת ארה”ב, בעקבות צו נשיאותי שקשור לבחינת בטיחות של מודלים בחזית. המשפחה יוצאת בשלוש רמות: Sol, דגם הדגל, במחיר של 5$ לקלט ו-30$ לפלט למיליון טוקנים; Terra, דגם ביניים במחיר 2.50$ ו-15$ שלדברי OpenAI משתווה ל-GPT-5.5 בחצי העלות; ו-Luna, רמה מהירה וזולה במחיר 1$ ו-6$.

OpenAI X post screenshot.
הכרזת ChatGPT 5.6 Sol דרך X.

OpenAI מדווחת ש-Sol מוביל את Artificial Analysis Coding Agent Index ומגיע ל-88.8% ב-Terminal-Bench 2.1, ועולה ל-91.9% כאשר המודל מריץ ארבעה תת-סוכנים במקביל תחת מצב ה-ultra החדש שלו. שלוש הרמות נושאות את דירוג הסיכון הפנימי הגבוה ביותר של OpenAI לפוטנציאל שימוש לרעה בסייבר ובביולוגיה, מה שהוביל לביקורת נוספת במהלך התצוגה המוקדמת המוגבלת על ידי הממשלה.

Kimi K3 דוחף מודלים עם משקלים פתוחים לעבר החזית

Moonshot AI שחררה את Kimi K3 ב-16 ביולי, מודל mixture of experts עם 2.8 טריליון פרמטרים, עם 896 מומחים בסך הכול ו-16 פעילים לכל משימה. למודל חלון הקשר של 1 מיליון טוקנים וקלט מולטימודלי מובנה, עם תמחור API של 3$ לקלט ו-15$ לפלט למיליון טוקנים. Moonshot התחייבה לפרסם משקלים פתוחים מלאים עד 27 ביולי.

Kimi Moonshot X post screenshot.
הכרזת Kimi K3 דרך X.

K3 הוא המודל הגדול ביותר עם משקלים פתוחים שיצא עד כה, גדול בכ-75% מהמודל הפתוח הקודם הגדול ביותר שהיה בשימוש נרחב. עוקבים עצמאיים ממקמים את K3 במקום הרביעי בין מערכות החזית הנוכחיות, מאחורי Claude Fable 5 ו-GPT-5.6 Sol אך לפני Claude Opus 4.8.

מדוע הפער מול מודלים ותיקים חשוב

חלונות הקשר מתחת ל-200,000 טוקנים אילצו בעבר מפתחים לפרק בסיסי קוד גדולים או חבילות מחקר למקטעים. כל מודל בקבוצה הזו רץ כעת על 500,000 טוקנים ומעלה, כאשר שלושה מתוך הארבעה מגיעים ל-1 מיליון, מה שמאפשר לסשן יחיד להחזיק מאגר שלם או ערימה של מסמכי מקור ראשוניים.

גם אמינות הסוכנים השתפרה. מערכות מתקופת 2023 ו-2024 איבדו לעיתים קרובות את התוכנית לאחר מספר קטן של קריאות לכלים. המודלים ששוחררו החודש נבנו כדי להחזיק עשרות צעדים מתואמים ולהתאושש כאשר קריאת כלי מחזירה נתונים שגויים במקום להיתקע.

עבור מפתחים, ההשפעה המעשית היא עלות נמוכה יותר לכל משימה שמסתיימת, ולא תקרה גבוהה יותר בכל בנצ’מרק יחיד. בקרות המאמץ ב-Opus 5, תמחור מדורג ב-GPT-5.6, וטענות היעילות שמאחורי Grok 4.5 מצביעים כולם לאותה מטרה: לאפשר לצוותים לבחור כמה חישוב משימה ראויה לקבל במקום לשלם מחירי דגם דגל עבור כל בקשה.

עבור ארגונים ומקבלי החלטות, ההשקה המוגבלת על ידי הממשלה של GPT-5.6 מאותתת שהפיקוח מוטמע כעת בלוחות הזמנים של השקות עבור המודלים הגדולים ביותר, ולא נוסף בדיעבד. ההשעיה הקצרה של Anthropic, בהנחיית הממשלה, של גישה ל-Fable ול-Mythos ביוני הייתה גרסה מוקדמת של אותו דפוס.

מאמר זה תורגם מאנגלית באמצעות בינה מלאכותית. הגרסה המקורית באנגלית היא המקור הקובע; תרגומים אוטומטיים עשויים להכיל אי-דיוקים, במיוחד במונחים משפטיים ורגולטוריים.