דלג לתוכן
Grok 4.6 מצטיין בעבודת ידע ונשאר אחרון בטרמינל
חדשות
#news #ai-agents #automation #strategy

Grok 4.6 מצטיין בעבודת ידע ונשאר אחרון בטרמינל

המודל החדש של xAI זול פי שלושה מ-Opus 5 ומשתפר דרמטית בעבודת ידע, אבל דווקא בהרצת סוכנים ארוכים הוא עדיין מפגר. מה זה אומר על המודל שיושב לכם בלולאה.

צוות Focus AI
8 דקות קריאה

xAI שחררה את Grok 4.6 ב-12 באוגוסט, ושישה ימים אחר כך נתוני התנועה של OpenRouter כבר מראים מי מריץ אותו. שני שמות בולטים שם מעל כל השאר: אפליקציית סוכן בשם Hermes Agent שצרכה עליו 66.9 מיליארד טוקנים, וסוכן קוד בשם pi שהוסיף עוד 20 מיליארד. נפח כזה מגיע ממערכות שרצות בלולאה ושורפות טוקנים בכל שעה, ולא ממפתחים שפתחו טרמינל בערב אחד כדי לראות מה המודל החדש יודע.

אם יש לכם סוכן שרץ בפרודקשן, אתם מכירים את השבוע הזה. יוצא מודל, הטבלה נראית מצוין, וצריך להחליט אם מזיזים את מה שיושב בלב הלולאה או ממשיכים לשלם למי שכבר עובד. השאלה הזאת, בניסוח “האם להחליף מודל”, מניחה מראש שיש מודל אחד בלולאה. השחרור הזה הופך בדיוק את ההנחה הזאת ליקרה.

רגע, מה זה בכלל סוכן שרץ בלולאה

צ’אט מקבל שאלה ומחזיר תשובה. סוכן מקבל מטרה, מפרק אותה לשלבים, מריץ כלים, בודק את התוצאה וממשיך לשלב הבא. בכל סיבוב כזה נשלח למודל כל מה שקרה עד אותו רגע, ולכן הבקשה תופחת ככל שהמשימה מתקדמת. שם נולד גם החשבון החודשי וגם רוב התקלות.

טוקן הוא יחידת הטקסט שלפיה המודלים סופרים, וכל חיוב מבוסס עליה. קלט הוא כל מה שאתם שולחים למודל, פלט הוא כל מה שהוא כותב בחזרה, וכל אחד מהם מתומחר בנפרד.

מה xAI שינתה במודל

Grok 4.6 הוא לא מודל בסיס חדש. xAI השאירה את הבסיס של Grok 4.5 והשקיעה בכל מה שבא אחריו. קודם ריצת אימון משלימה ארוכה יותר, ואחריה דאטה שנוצר על ידי מודל ונבחר בקפידה לנושאי חשיבה והנדסה. בסוף הגיעה למידת חיזוק בתוך סביבות סוכנים ממשיות: עבודת ידע, כתיבת קוד, פיתוח ווב, תכן ממוחשב ואופטימיזציה של קרנלים.

השלב הזה נקרא post-training, כלומר כל האימון שבא אחרי שמודל הבסיס כבר קיים. שם מלמדים את המודל איך לענות, מתי לעצור ואיך להשתמש בכלים שקיבל. השינוי כאן יושב כולו בשלב הזה, ולא בקפיצת דור.

התוצאה בכל זאת ניכרת כמעט בכל מקום שמדדו בו:

  • מדד Artificial Analysis Intelligence Index: עלייה מ-56 ל-61
  • GDPval-AA v2: מ-1526 ל-1753 נקודות אלו
  • DeepSWE v1.1: מ-54 אחוז ל-65.9 אחוז, כמעט 12 נקודות
  • Terminal-Bench v3.0: מ-15.7 אחוז ל-26 אחוז

למי שמריץ סוכנים, ההרגל ההתנהגותי מעניין כאן יותר מהציון. xAI מתארת מודל שמאמת את עצמו לאורך מסלולים ארוכים, בודק את העבודה שלו תוך כדי, ויודע לעצור כשתת משימה באמת הסתיימה. אם ראיתם פעם סוכן ממשיך לנבור בקוד עשר דקות אחרי שהמשימה נגמרה, אתם יודעים כמה ההרגל הזה שווה. כל טוקן בדרך הזאת נכנס לחשבון. במקביל נוסף מפלס חשיבה חדש בשם xhigh, מעל low, medium ו-high. המפלס קובע כמה המודל יחשוב לפני שהוא עונה.

איפה הוא מוביל, ואיפה הוא נשאר אחרון

הצורה של הטבלה מספרת בסוף יותר מהשורה העליונה שלה. בכל מה שנוגע לעבודת ידע Grok 4.6 מוביל או צמוד מאוד לפסגה:

  • GDPval-AA v2: 1753 מול 1728 ל-GPT-5.6 Sol Max ו-1741 ל-Fable 5 Max
  • AA-Briefcase: 1577 מול 1502 ו-1574 בהתאמה
  • Harvey LAB, בנצ’מרק משפטי: 15.8 אחוז מול 2.5 אחוז ו-11.3 אחוז

במשימות שבהן הסוכן יוצא מהצ’אט ומתחיל להריץ פקודות התמונה מתהפכת לגמרי:

  • Terminal-Bench v3.0, שבודק הרצת משימות בטרמינל לאורך זמן: 26 אחוז, אחרון מבין ארבעת המודלים בטבלה, מול 34.6 ו-34.1 אחוז
  • DeepSWE v1.1: 65.9 אחוז מול 73 ו-70

המודל ששווק ככלי לסוכנים ארוכי טווח השתפר בעיקר בחצי החושב של העבודה. החצי שמבצע אותה בפועל נשאר בערך במקום.

A long night-shift factory conveyor where a single robotic arm picks up an object, holds it under a lamp to inspect it,

המספר של Terminal-Bench ראוי לתשומת לב מסיבה נוספת, שכבר לא קשורה ל-xAI. גם המוביל בקטגוריה נכשל בשני שלישים מהמשימות. סוכן שמריץ פקודות במערכת אמיתית לאורך שעות הוא עדיין הימור, בכל מודל שתבחרו. תהליך עסקי שמניח אחרת עומד על חול, גם אם המודל שמריץ אותו עולה פי חמישה.

המדרגה ב-200 אלף טוקנים

התמחור הוא הסיפור השני של השחרור, ולמי שמפעיל מערכת בפרודקשן הוא כנראה החשוב מבין השניים. אלה המחירים למיליון טוקנים:

  • Grok 4.6: 2 דולר קלט, חצי דולר קלט מטמון, 6 דולר פלט, חלון הקשר של 500 אלף טוקנים
  • Claude Opus 5: 5 דולר קלט, 25 דולר פלט
  • GPT-5.6 Sol: 5 דולר קלט, 30 דולר פלט, אחרי הורדת המחיר של יולי

חלון ההקשר הוא כמות הטקסט שהמודל מחזיק בבקשה אחת, כלומר כל מה שעומד מול העיניים שלו באותו רגע. קלט מטמון הוא החלק בפרומפט שחוזר על עצמו בין בקשות, ולכן הוא מחויב בזול.

אלא שהתיעוד של xAI מכיל סעיף שקל מאוד לפספס. בקשה שהפרומפט שלה מגיע ל-200 אלף טוקנים עוברת לתעריף גבוה: 4 דולר קלט, דולר למטמון ו-12 דולר פלט. התעריף הזה חל על כל הטוקנים בבקשה, ולא רק על החלק שמעבר לסף.

הסעיף הזה נוגע בדיוק בסוג העומס שהמודל נבנה בשבילו. סוכן שרץ הרבה זמן צובר הקשר מעצם ההגדרה שלו: היסטוריית כלים, פלטי טרמינל, קבצים שנקראו באמצע. הוא מטפס לאט לכיוון הסף ואף אחד לא עוקב אחרי זה. ברגע החצייה התעריף הכפול חל על מלוא הבקשה, כולל מאות אלפי הטוקנים שנצברו לפני כן.

אם אתם מריצים סוכנים ארוכים על Grok 4.6, כדאי לנהל את זה בכוונה תחילה. דחיסת הקשר, מטמון פרומפט ונקודות עצירה שמאתחלות את החלון. אחרת החשבון בסוף החודש ישתנה בלי ששורה אחת בקוד השתנתה, וייקח לכם זמן להבין למה.

מה זה אומר לעסק שכבר מריץ סוכנים

ניקח סוכן שמטפל בפניות נכנסות. הוא קורא את הפנייה, מושך הקשר מה-CRM, מסווג, מנסח טיוטת תשובה ומעביר לאישור אנושי. משימה כזאת צורכת בערך מיליון טוקני קלט ורבע מיליון פלט, וזה מה שהיא עולה:

  • Grok 4.6: כ-3.5 דולר להרצה
  • Claude Opus 5: כ-11.25 דולר
  • GPT-5.6 Sol: כ-12.5 דולר

בהרצה בודדת ההפרש הזה לא מזיז לאף אחד. באלף הרצות ביום, נפח סביר לחברת שירות בינונית, מדובר כבר בקרוב לשמונת אלפים דולר ביום בין הזול ליקר, ושם ההחלטה באמת נולדת.

הפרמטר שכדאי למדוד לפיו הוא כמה עולה כשל בכל שלב בנפרד, והציון הכללי אומר על זה מעט מאוד. ברוב שלבי הסוכן כשל הוא זול: סיווג פנייה, חילוץ שדות, סיכום שיחה, טיוטה ראשונה של מענה. בכל אלה הפער בין 61 ל-63 במדד האינטליגנציה לא מצדיק תשלום כפול ויותר. אם המודל טועה, מישהו יתקן אותו לפני שמשהו יוצא מהדלת.

יש גם שלבים שבהם כשל יקר: כתיבה למסד נתונים, שליחת מייל ללקוח, שינוי מחיר או הרצת פקודה על שרת חי. שם החיסכון של שלושה דולר להרצה מפסיק להיות שיקול. המודל היקר נשאר במקומו, וטבלת Terminal-Bench מסבירה בדיוק למה זה עדיין נכון גם אחרי השיפור.

Bot-Camp
רוצים לדעת באילו שלבים כדאי לשלם על המודל היקר?
Bot-Camp הוא 12 מפגשים ו-152 שעות אקדמיות של בנייה בפועל, על n8n וסוכני AI. בין השאר עוסקים שם בפירוק לולאה לשלבים ובשאלה כמה עולה טעות בכל אחד מהם.
n8nClaudeסוכני AIאוטומציה
שמרו לי מקום

שווה גם לזכור שהמסגרת של Grok מול Claude מסתירה אפשרות שלישית. Gemini 3.1 Pro מתומחר בדולר אחד לקלט ו-6 דולר לפלט, עם חלון של מיליון טוקנים ובלי מדרגת תמחור באמצע. ניתוב בין מודלים הוא מנגנון ששולח כל שלב בלולאה למודל אחר לפי הצורך, והגישה הזאת הולכת ומשתלטת על מערכות רציניות. אם אתם בונים אחד כזה, יש לכם עכשיו שלוש נקודות מחיר שונות מאוד לאותה לולאה בדיוק.

A wide control room at night where one operator faces a bank of identical dim monitors, with a single screen in the midd

מי בוחר בפועל איזה מודל רץ אצלכם

יש כאן זווית שנעלמת כשקוראים רק בנצ’מרקים. Grok 4.6 הוא מודל ברירת המחדל ב-Grok Build, והוא נכנס ל-Cursor בכל התוכניות. Cursor, כלומר Anysphere, נרכשה על ידי SpaceX בעסקת מניות בשווי 60 מיליארד דולר. זה קרה אחרי ש-SpaceX ו-xAI התמזגו מוקדם יותר השנה, והרכישה הושלמה ב-14 באוגוסט, יומיים אחרי שחרור המודל.

למפתח שיושב מול IDE זה מסתכם בעובדה אחת. המודל שמריץ את הסוכן שלו נבחר לא פעם על ידי מי שמחזיק בכלי, ולא על ידי מי שקרא טבלת ציונים. בחירה שנראית טכנית לגמרי היא לעיתים קרובות תוצר של מי קנה את מי ברבעון האחרון. זאת סיבה טובה להחזיק את הלוגיקה של הסוכן אצלכם, מאחורי שכבת הפשטה מעל ספק המודל, במקום לתת לסביבת הפיתוח להחליט מה רץ בפרודקשן.

מה שכן זז השבוע הוא המחיר של כל השכבות שסביב הליבה. שלבים שהיו יקרים מדי מכדי להריץ אותם אלף פעם ביום נכנסים עכשיו לתקציב. הליבה עצמה, אותם רגעים בודדים שבהם הסוכן נוגע במערכת חיה, נשארת בדיוק איפה שהייתה, ו-Grok 4.6 לא משנה שם כלום.

כדי לנצל את זה לא צריך להחליף מודל. צריך רשימה של השלבים בלולאה, ולידה עמודה אחת שאומרת כמה עולה טעות בכל אחד מהם. מי שכבר מפעיל ניתוב בין מודלים יסיים את העבודה באחר צהריים אחד. מי שמחזיק מודל יחיד לכל הלולאה יגלה שהחלק הקשה הוא פירוק התהליך לשלבים. זאת עבודה של כמה ימים שנדחית כבר שנה, כי כל עוד יש מודל אחד בקוד נוח להסתכל על חשבון ה-API כמספר אחד גדול. ברגע שמפרקים אותו לשלבים מתגלה שרשרת של החלטות קטנות שאף אחד לא קיבל במפורש.

שאלות ותשובות

כמה עולה Grok 4.6 לעומת Claude Opus 5?

Grok 4.6 עולה 2 דולר למיליון טוקני קלט ו-6 דולר למיליון טוקני פלט, לעומת 5 ו-25 דולר ב-Claude Opus 5. במשימת סוכן טיפוסית שצורכת מיליון טוקני קלט ורבע מיליון פלט, ההפרש הוא בערך 3.5 דולר מול 11.25 דולר להרצה. ההפרש הזה כמעט חסר משמעות בהרצה בודדת, והוא הופך למשמעותי מאוד כשמריצים אלפי הרצות ביום.

האם Grok 4.6 מתאים לסוכנים שרצים בפרודקשן?

הוא מתאים מאוד לשלבים של סיווג, סיכום, ניסוח וטיוטה ראשונה, שם הוא מספק תוצאה קרובה מאוד למודלים היקרים בשליש מהמחיר. בשלבים שבהם הסוכן מריץ פקודות בטרמינל ומתקן את עצמו לאורך שעות הוא עדיין נופל מ-GPT-5.6 Sol Max ומ-Fable 5, לפי טבלת הבנצ'מרקים של xAI עצמה. הגישה המעשית היא לנתב בין מודלים לפי שלב במקום לבחור מודל אחד לכל הלולאה.

מה זה חלון ההקשר של 500 אלף טוקנים ב-Grok 4.6, ולמה צריך לשים לב למחיר?

חלון ההקשר הוא כמות הטקסט שהמודל יכול להחזיק בבקשה אחת, ו-Grok 4.6 תומך ב-500 אלף טוקנים. הנקודה שחשוב להכיר היא שבקשה שחוצה 200 אלף טוקנים מחויבת בתעריף כפול על כל הטוקנים בבקשה, ולא רק על החלק שמעבר לסף. סוכן ארוך שצובר הקשר יכול לחצות את הסף בלי שאף אחד ישים לב ולהכפיל את העלות של ההרצה כולה.

שתפו את הכתבה

X LinkedIn WhatsApp

מה הלאה

שלוש דרכים להמשיך, לפי כמה שאתם קרובים להחליט.

רוצים ללמוד לבנות סוכני AI ואוטומציות?

ב־Bot-Camp תלמדו לבנות סוכני AI ואוטומציות עסקיות מאפס לפרודקשן. 152 שעות אקדמיות בליווי אקדמי של היחידה ללימודי חוץ באוניברסיטת חיפה. ללא צורך בידע מוקדם.

עוד כתבות שיעניינו אתכם

כתבות נוספות

יועץ לימודים