דלג לתוכן
ההנחה על Gemini 3.7 Flash נגמרת בינואר, השינוי בקוד שלכם נשאר
חדשות
#news #ai-agents #automation #tools

ההנחה על Gemini 3.7 Flash נגמרת בינואר, השינוי בקוד שלכם נשאר

גוגל שחררה את Gemini 3.7 Flash בחצי מחיר, 23 יום אחרי הדגם הקודם. מה באמת השתנה למי שבונה סוכנים, ולמה temperature כבר לא עובד שם

צוות Focus AI
7 דקות קריאה

גוגל (Google) שחררה את Gemini 3.7 Flash ב־13 באוגוסט 2026, עשרים ושלושה ימים אחרי הדגם הקודם, בחצי מחיר ועם חתימת API שונה. גוגל הציגה אותו כ”דגם סוס העבודה החכם ביותר שלנו עד היום לקוד ולסוכנים”. הוא זמין דרך ה־API, דרך AI Studio, דרך Antigravity ו־Android Studio, ודרך Vertex AI ופלטפורמת הסוכנים הארגונית.

כרטיס הביקור עצמו כמעט לא זז. מזהה הדגם הוא gemini-3.7-flash, חלון ההקשר נשאר 1,048,576 טוקנים, תקרת הפלט 65,536, וסף הידע מרץ 2026. מה שכן זז יושב בשלושה מקומות: המחיר, ציוני הבנצ׳מרק וחתימת ה־API. אם חיברתם סוכן על Gemini 3.6 Flash בחודש שעבר, שני האחרונים נוגעים לכם ישירות.

הפרמטרים שגוגל מבקשת שתמחקו

מסמך המעבר של גוגל מבקש להוציא מקונפיגורציית הייצור ארבעה פרמטרים מוכרים: temperature, top_p, top_k ו־candidate_count. במקומם נכנס thinking_level, כלומר פרמטר שקובע כמה עומק חשיבה הדגם משקיע לפני שהוא עונה. יש לו שלושה ערכים בלבד:

  • low למשימות שרגישות להשהיה.
  • medium, ברירת המחדל, והערך המומלץ לקוד מורכב ולזרימות סוכן.
  • high לחשיבה עמוקה שמאפשרת מחשבות ארוכות וקריאות פונקציה בתוכן.

גם thinking_budget הוצא משימוש. הוא נתן לכם לתקצב מספר טוקנים מדויק למשימה, ובמקומו יש עכשיו שלוש רמות עם שמות. מי שכתב אורקסטרטור בשנתיים האחרונות, כלומר את שכבת הקוד שמחליטה מתי קוראים למודל ועם איזו קונפיגורציה, פיתח אינטואיציה שלמה על הידיות האלה. אתם יודעים מה קורה כשמורידים temperature לאפס, וכמה טוקני חשיבה מספיקים למשימה נתונה. לאינטואיציה הזאת אין עכשיו לאן להתחבר.

ניהול השיחה עובר לצד השרת

השינוי העמוק יותר יושב בזיכרון השיחה. גוגל מבקשת שתשלחו previous_interaction_id במקום להרכיב בעצמכם את תורות המודל ולשלוח אותן מחדש בכל קריאה. כלומר השרת מחזיק את ההיסטוריה ואתם מצביעים עליה. כמעט כל מי שכתב אורקסטרטור לפני 2026 בנה את הזיכרון הזה ידנית, ומגלה עכשיו שהתבנית שלו יצאה מהתמיכה הרשמית.

בשוליים יש עוד כמה תיקונים בקריאות פונקציה. אובייקטי FunctionResponse דורשים כעת שדות call_id ו־name. נכסים מולטימודליים חייבים לשבת בתוך גוף התשובה. לשגיאת Malformed_Function_Call, שנובעת מטקסט שהדגם פולט לפני קריאת כלי, יש עקיפה מתועדת.

עלות המעבר מתחלקת מאוד לא שווה. מי שרץ על n8n או על Make מחזיק צומת אחד עם הקריאה לדגם, משנה מזהה, מוחק שני שדות ומסיים לפני ההפסקה. מי שכתב אורקסטרטור משלו בפייתון או בטייפסקריפט, ופיזר קריאות ל־generateContent בשבעה מקומות עם קונפיגורציה מועתקת בכל אחד מהם, עומד מול כמה ימי עבודה. הסיכון שם הוא שמשהו יישבר בשקט, בלי שגיאה שתסמן איפה. לפני שאתם בודקים אם הדגם החדש טוב יותר, שווה לספור כמה מקומות בקוד שלכם יודעים איך קוראים למודל. המספר הזה יקבע כמה יעלה המעבר הבא, וגם זה שאחריו.

A developer's desk at night, a whiteboard behind it covered in a hand drawn agent orchestration diagram with boxes and a

בקוד הקפיצה גדולה, באוטומציה הרבה פחות

בקוד המספרים מצדיקים את הכותרת שגוגל נתנה לדגם:

  • FrontierCode 1.1: מ־34.4 אחוז ל־43.6.
  • DeepSWE v1.1: מ־49 ל־65.3.
  • WebDev Arena: 1,588 נקודות Elo מול 1,538 של קודמו.
  • הבנת מסמכים: מ־22 אחוז ל־34.

כרטיס הדגם של DeepMind מוסיף 85.8 אחוז ב־Terminal-bench 2.1, שבודק עבודה אגנטית בטרמינל, ו־97 אחוז ב־GDM-MRCR, שבודק שליפה מהקשר ארוך.

AutomationBench בודק את הדבר שאנשים בונים בפועל, כלומר משימות אוטומציה רב שלביות מקצה לקצה. הציון שם הוא 30.4 אחוז מול 17 אחוז בדגם הקודם, כמעט הכפלה, וגם הצהרה שהדגם נכשל בשבע מכל עשר משימות אוטומציה שלמות, כפי שדיווח DataNorth בסיקור השחרור. השימוש במחשב, שנמדד ב־OSWorld 2.0, עומד על 47.9 אחוז ומספר בערך את אותו דבר.

85.8 בטרמינל מול 30.4 מקצה לקצה זה פער שקשה לתלות בטעות מדידה. הדגם חזק בצעד בודד ובקטע בינוני של שרשרת. ככל שהמשימה דורשת יותר החלטות עצמאיות ברצף בלי אדם באמצע, ההסתברות שהיא תיגמר נכון נופלת מהר. כרטיס הדגם מנסח את זה בשפה של בטיחות, ואומר שהדגם חסר את העצמאות לשרשר משימות קוד לתהליכי מחקר שלמים בלי מעורבות אנושית. כלומר השדרוג קונה לכם צעדים טובים יותר, ולא שרשרת שסוגרת את עצמה. איפה בדיוק אדם נכנס לתמונה נשאר אצלכם, כמו קודם.

המחיר תקף עד 31 בדצמבר

טבלת המחירים של גוגל מפרטת 0.75 דולר למיליון טוקני קלט ו־3.75 דולר למיליון טוקני פלט, כולל טוקני חשיבה. המספרים תקפים עד 31 בדצמבר 2026, וב־1 בינואר 2027 הם מוכפלים ל־1.50 ול־7.50. שווה לזכור מה עמד שם קודם: Gemini 3.6 Flash יצא ב־21 ביולי במחיר 1.50 ו־7.50 בדיוק. מה שנקרא כאן הנחה הוא חלון של ארבעה חודשים וחצי, שבסופו המחיר חוזר לנקודה שממנה יצא.

כך נראים המחירים אצל המתחרים:

  • Claude Haiku 4.5, לפי המחירון של אנטרופיק (Anthropic): דולר לקלט וחמישה לפלט, עם קריאת מטמון בעשירית ממחיר הקלט ומצב אצווה בחצי.
  • Claude Sonnet 5: שניים ועשרה.
  • GPT-5.6 Luna: 0.20 ו־1.20, אחרי הפחתה של שמונים אחוז בסוף יולי.

בתוך חלון ההנחה Gemini 3.7 Flash זול מ־Haiku ויקר פי כמה מ־Luna. בינואר הוא עובר להיות יקר מ־Haiku וזול במעט מ־Sonnet 5. הוא משנה מקום בטבלה בלי ששורה אחת בקוד שלכם זזה.

את החשבון החודשי מזיז יותר מכל אלה מטמון ההקשר, כלומר קיבוע של החלק שחוזר בכל קריאה כך שלא תשלמו עליו מחדש. קלט מהמטמון עולה 0.075 דולר למיליון, עשירית ממחיר הקלט הרגיל, בתוספת חצי דולר למיליון טוקנים לכל שעת אחסון. סוכן שנושא איתו פרומפט מערכת קבוע, סכמות כלים ומסמכי מדיניות שחוזרים בכל קריאה מוריד את חשבון הקלט בסדר גודל שלם ברגע שהוא מקבע את החלק היציב. מצב אצווה חותך עוד חצי מכל עבודה שאינה בזמן אמת.

Bot-Camp
בונים סוכן שהחלפת הדגם שלו לוקחת יום עבודה
ב־12 מפגשים ו־152 שעות אקדמיות אתם בונים סוכנים ואוטומציות על n8n בארכיטקטורה שהדגם בתוכה הוא רכיב מוחלף. עובדים על מקרים אמיתיים מהעסק שלכם, לא על תרגילי מעבדה.
n8nClaudeסוכני AIאוטומציה
שמרו לי מקום

מה זה אומר לעסק ישראלי שמריץ אוטומציה

בזמינות, לשם שינוי, ישראל יושבת בצד הנוח של הגדר. גוגל פתחה את הדגם באפליקציית Gemini דרך Spark למנויי Pro ו־Ultra ביותר ממאה ושישים מדינות, והחריגה מהרשימה את האזור הכלכלי האירופי, בריטניה, שווייץ וניגריה. עסק ישראלי מקבל את הדגם בגרסת הצרכן ובגרסת ה־API באותו יום שבו מקבלים אותו בארצות הברית, בזמן שמתחרה גרמני מחכה לרגולציה. את היתרון הזה כדאי לגבות דווקא בחודשים המוזלים.

קחו סוכן שירות טיפוסי. הוא קורא פנייה נכנסת, שולף הקשר ממערכת פנימית, מסווג ומנסח טיוטת תשובה. נניח שהוא צורך עשרים אלף טוקני קלט ושלושת אלפים טוקני פלט בכל הרצה. עשרת אלפים הרצות בחודש הן מאתיים מיליון טוקני קלט, 150 דולר, ושלושים מיליון טוקני פלט, 112.5 דולר, קצת מעל 260 דולר בסך הכול. ב־1 בינואר אותה עבודה בדיוק תעלה מעל 520.

עכשיו נניח שחמישה עשר אלף מתוך עשרים אלף טוקני הקלט הם פרומפט מערכת וסכמות כלים. החלק הזה אינו משתנה בין הרצה להרצה, ואתם משלמים עליו מלא בכל פעם. קיבוע שלו במטמון מוריד את רכיב הקלט מ־150 דולר לכ־11, בתוספת כמה דולרים של אחסון. זה חיסכון גדול בהרבה מכל מה שהחלפת ספק תעשה לכם.

סדר הפעולות שיחסוך לכם ימים

הפיתוי המובן הוא לנצל את חלון ההנחה ולהזרים עכשיו כמה שיותר עבודה לדגם הזול. אלא שארבעה חודשים וחצי אינם זמן ארוך מספיק כדי להחזיר השקעה של שכתוב שכבת תזמור שלמה. הסדר ההגיוני הפוך. קודם תבדקו את התהליכים שבהם הדגם הקודם נכשל, כי שם הקפיצה בקוד ובהבנת מסמכים היא ההבדל בין אוטומציה שעובדת לאוטומציה שנזנחה אחרי שבועיים. רק אחר כך תעבירו את מה שכבר רץ היטב. הבדיקה עצמה לא עולה כלום, כי ב־AI Studio יש שכבה חינמית שמספיקה בהחלט כדי לראות אם התהליך שנתקע אצלכם בחודש שעבר עובר עכשיו.

A close up of a factory conveyor belt where identical parts move past, but one station on the line is being swapped out

שלושה שבועות ויום הפרידו בין שני דגמי Flash, ובפער הזה השתנו המחיר, ציוני הבנצ׳מרק וחלק מחתימת ה־API. עסק שבנה את האוטומציה שלו כך שהדגם הוא רכיב מוחלף עובר בין הדגמים ביום עבודה וגובה את ההנחה כרווח נקי. זה אומר שכבת תזמור אחת שיודעת לקרוא למודל, לוגים על כל קריאת כלי, ונקודות בקרה אנושיות בדיוק במקומות שבהם המשימה מסתעפת. עסק שכתב את הלוגיקה שלו לתוך קריאה אחת גדולה עם temperature מכוונן ביד ישקיע את אותם ימים כדי להישאר במקום שבו היה.

התאריך שכדאי לסמן ביומן הוא 31 בדצמבר, היום שאחריו אותה עבודה עולה כפול. עד אז יש לכם חלון לבדוק את התהליכים התקועים, למפות את כל המקומות שקוראים למודל ולקבע במטמון את החלק היציב של הפרומפט. המרחק בין 85.8 אחוז ב־Terminal-bench לבין 30.4 אחוז ב־AutomationBench לא זז בעשרים ושלושה הימים האלה, בזמן שהמחיר, הפרמטרים והציונים זזו כולם. הפירוק לצעדים, הלוגים, הבדיקות ונקודות ההכרעה האנושיות נשארים העבודה שלכם, והם שיקבעו כמה יעלה לכם הדגם הבא.

שאלות ותשובות

כמה עולה Gemini 3.7 Flash לאלף קריאות של סוכן?

המחיר ההתחלתי של Gemini 3.7 Flash הוא 0.75 דולר למיליון טוקני קלט ו־3.75 דולר למיליון טוקני פלט, עד 31 בדצמבר 2026. סוכן ממוצע שצורך 20 אלף טוקני קלט ו־3,000 טוקני פלט בכל הרצה יעלה בערך 26 דולר לאלף הרצות. ב־1 בינואר 2027 המחיר עולה ל־1.50 ו־7.50 דולר, כלומר אותה עבודה תעלה כפול.

האם כדאי להעביר סוכן קיים מ־Gemini 3.6 Flash ל־3.7 Flash?

המעבר משתלם בעיקר לסוכנים שמריצים משימות רב שלביות או עובדים על קוד, כי שם הפער בין הדגמים הוא הגדול ביותר. חשוב לדעת שהמעבר אינו החלפת מחרוזת בלבד, כי גוגל ביטלה ב־3.7 Flash את הפרמטרים temperature, top_p ו־top_k, והחליפה את thinking_budget ב־thinking_level. סוכן שנשען על הכיוונונים האלה דורש עדכון בשכבת התזמור לפני שהוא רץ.

מה זה thinking_level ב־Gemini 3.7 Flash?

thinking_level הוא פרמטר שקובע כמה עומק חשיבה הדגם משקיע לפני שהוא עונה, והוא מקבל אחד משלושה ערכים: low, medium ו־high. רמת medium היא ברירת המחדל והיא המומלצת לקוד מורכב ולזרימות סוכן, low מיועד למשימות שרגישות להשהיה כמו צ׳אט בזמן אמת, ו־high מיועד למשימות הקשות ביותר. הרמה minimal אינה נתמכת בדגם הזה.

שתפו את הכתבה

X LinkedIn WhatsApp

מה הלאה

שלוש דרכים להמשיך, לפי כמה שאתם קרובים להחליט.

רוצים ללמוד לבנות סוכני AI ואוטומציות?

ב־Bot-Camp תלמדו לבנות סוכני AI ואוטומציות עסקיות מאפס לפרודקשן. 152 שעות אקדמיות בליווי אקדמי של היחידה ללימודי חוץ באוניברסיטת חיפה. ללא צורך בידע מוקדם.

עוד כתבות שיעניינו אתכם

כתבות נוספות

יועץ לימודים