Claude Opus 5.5: ברמה של Fable 5.1, בעלות נמוכה ב-40% מ-Opus 5

המחיר לטוקן ירד, וגם כמות הטוקנים שהוא צורך לכל משימה
מחירי API למיליון טוקנים, לעומת Opus 5
ב-22 בספטמבר Anthropic השיקה את Claude Opus 5.5, הדגם הראשון במשפחה חדשה, Claude 5.5. לפי ההכרזה, ברוב סוגי העבודה הוא מגיע לרמה של Fable 5.1, הדגם החזק והיקר של החברה, ובהגדרות הרגילות הוא עולה כ-40% פחות מ-Opus 5 שקדם לו. המחיר לטוקן ירד רק ב-20%. את השאר הוא חוסך בכך שהוא מסיים את אותן משימות עם פחות טוקנים.
Anthropic מדווחת גם על פלט מהיר ב-30% ויותר לעומת Opus 5, על כתיבה ברורה יותר ועל ציוני בטיחות טובים יותר. יחד עם ההשקה היא גם הגדילה את מכסות השימוש במנויים בתשלום.
איפה אפשר להשתמש בו
באתר ובאפליקציות של Claude למנויי Pro, Max, Team ו-Enterprise, ב-Claude Code, וב-API תחת השם claude-opus-5-5. הוא זמין גם ב-Amazon Bedrock, ב-Google Cloud וב-Microsoft Foundry. המנוי החינמי לא כולל דגמי Opus.
בקוד, גם ההגדרה הרגילה עוקפת את Fable 5.1
כמו דגמי Claude האחרונים, Opus 5.5 חושב לפני שהוא עונה, ואפשר לקבוע כמה. יש חמש רמות מאמץ (effort), מ-low ועד max, וככל שהרמה גבוהה יותר המודל חושב יותר זמן והמשימה עולה יותר. ב-Opus 5.5 ברירת המחדל היא medium, רמה אחת מתחת לזו של Opus 5. Anthropic פרסמה גרפים שמראים מה מקבלים בכל רמה ובאיזה מחיר, ושחזרתי כאן אחד מהם מתוך הנתונים שבהכרזה:
Terminal-Bench 4.0: ציון מול עלות לכל ניסיון
- Opus 5.5
- Fable 5.1
- Opus 5
- GPT-6 Astra
- GPT-5.6 Sol
כל נקודה היא רמת מאמץ אחת, מ-low (הזולה) ועד max. שחזור של הגרף מההכרזה של Anthropic, מתוך הנתונים שהיא פרסמה בעמוד. את הציונים של GPT-6 Astra ו-GPT-5.6 Sol מסרה OpenAI. מקור: anthropic.com
הנתונים של הגרף בטבלה
| דגם | low | medium | high | xhigh | max |
|---|---|---|---|---|---|
| Opus 5.5 | 38.5%$1.29 | 57.6%$2.94 | 64.2%$3.88 | 66.4%$7.35 | 64.8%$11.24 |
| Fable 5.1 | 40.2%$5.70 | 43.4%$7.80 | 49.4%$10.50 | 51.3%$15.80 | 55.8%$19.50 |
| Opus 5 | 28.5%$4.25 | 41.2%$7.00 | 47%$10.64 | 50.6%$13.48 | 52.3%$15.83 |
| GPT-6 Astra | 49.7%$4.95 | 53.9%$6.15 | 57.9%$7.21 | 57.6%$7.48 | 56.7%$10.35 |
| GPT-5.6 Sol | 7.9%$1.46 | 20.9%$2.69 | 26.1%$4.12 | 28.5%$5.39 | 37.3%$7.89 |
Terminal-Bench 4.0 בודק משימות מקצועיות מרובות שלבים בשורת הפקודה. Opus 5.5 ברמת medium קיבל בו 57.6%, בעלות של 2.94 דולר לניסיון. Fable 5.1 הגיע במאמץ המקסימלי ל-55.8% ב-19.50 דולר, ו-Opus 5 ל-52.3% ב-15.83 דולר. Anthropic כותבת שברירת המחדל של Opus 5.5 עוקפת את Opus 5 במאמץ המקסימלי בכחמישית מהעלות, ומשתווה ל-GPT-6 Astra בכ-40% מהעלות.
אותה תמונה חוזרת בשני מבחני הקוד האחרים שיש להם גרפים בהכרזה. ב-FrontierCode, שבודק אם שינויי הקוד של הסוכן היו מתקבלים לפרויקט, Opus 5.5 ברמת medium קיבל 54.6%, יותר מכל אחת מרמות המאמץ של Fable 5.1 (הגבוהה שבהן: 52.8%). ב-CursorBench, שבנוי ממשימות אמיתיות מתוך Cursor, הוא קיבל 52.5% לעומת 51.8% של Fable 5.1 במקסימום.
בעבודה משרדית זה פחות חד-משמעי. במבחן GDPval-AA, שבודק משימות מקצועיות ב-44 מקצועות, רמת medium מקבלת 1,576 נקודות Elo, פחות מ-1,735 של Fable 5.1 במקסימום. Opus 5.5 עוקף אותו רק מרמת xhigh, עם 1,820 נקודות, וגם אז העלות למשימה היא כ-4.21 דולר לעומת 9.59 דולר אצל Fable 5.1.
בפועל, בקוד אפשר להישאר בברירת המחדל, ובניתוח ארוך של מסמכים, דוחות או מודלים פיננסיים כדאי להעלות את רמת המאמץ. באפליקציה של Claude עושים את זה בהגדרת Effort שבבורר המודלים. לפי Anthropic, את הרמה הגבוהה ביותר עדיף לשמור לבעיות הקשות ביותר, כי היא לוקחת יותר זמן וגם יותר ממכסת השימוש.
מה השתנה בעבודה עצמה
מעבר למבחנים, ההכרזה מתארת ניסויים שבהם Opus 5.5 ודגם אחר קיבלו את אותה משימה בדיוק. ארבעה מהם, עם המספרים:
ביקורת ותיקון של 200,000 שורות קוד
בודק שקיבל גישה מוקדמת נתן ל-Opus 5.5 לעבור על בסיס קוד שלם ולתקן אותו. Opus 5 עבד על אותה משימה יותר מ-20 שעות, ובפי 2.5 טוקנים.
HAProxy: תרגום מ-C ל-Rust
Anthropic נתנה ל-Opus 5.5 ול-Fable 5.1 לתרגם את HAProxy, תוכנה נפוצה לחלוקת עומסים בין שרתים. שני התרגומים עברו כמעט את כל בדיקות הרגרסיה של הפרויקט, והעלות של Opus 5.5 הייתה נמוכה ב-51%.
דוח רבעוני שנבדק מספר אחר מספר
שלושה דגמים כתבו דוח על רבעון של חברה, מתוך עותק של הרשת שבו קשה למצוא את הדוח הכספי. בודק אוטומטי השווה כל מספר וכל ציטוט למקור, ופרט מומצא אחד הכשיל את הדוח.
ניתוח מיזוג, מאקסל ועד מצגת
Opus 5.5 ו-Opus 5 בנו מודל פיננסי באקסל להצעת מיזוג בין שתי חברות בדיוניות, והפכו אותו למצגת להנהלה. שניהם הגיעו לאותה מסקנה. אצל Opus 5 היו טעויות קטנות, והעלות של Opus 5.5 הייתה חצי.
מקור: ההכרזה של Anthropic. את הביקורת על 200,000 השורות דיווח בודק שקיבל גישה מוקדמת. שלושת האחרים הם ניסויים של Anthropic עצמה.
בהכרזה מופיעים גם לקוחות עם מספרים משלהם. Deloitte, למשל, מדווחת שגם ברמת המאמץ הנמוכה ביותר Opus 5.5 תפס 72% מהבאגים הידועים בביקורות הקוד שלה, לעומת 56% של Opus 5 ברמה גבוהה, ועם פחות התראות שווא.
כותב ברור יותר
את השיפור הזה קשה יותר למדוד, אבל Anthropic שמה עליו דגש: Opus 5.5 פותח בדבר החשוב ומשתמש בפחות ז'רגון, ולפי החברה גם מקפיד יותר על כללי כתיבה שנותנים לו. בהכרזה יש השוואה בין שני הדגמים כשהם מסבירים את אותו באג בחיוב:
"הירידה הנוספת לא נובעת מהמסלול החינמי. זו רגרסיה ב-commit 0552feb, שסומן כ-No behaviour change."
"השינוי במסלול החינמי אחראי רק ל-1.50 דולר מהירידה של הלקוח באוגוסט. 9.92 הדולרים האחרים מגיעים מבאג ב-commit 0552feb."
תרגום חופשי ומקוצר של שורות הפתיחה מתוך ההשוואה בהכרזה.
Opus 5 נכנס ישר לפרטים הטכניים. Opus 5.5 נותן קודם את השורה התחתונה במספרים, ורק אחר כך מסביר את הקוד. לפי Anthropic, זה עונה על אחת התלונות הנפוצות על Opus 5.
טבלת ההשוואה: Opus 5.5 מול Claude ומול OpenAI
בטבלה הרשמית של Anthropic, Opus 5.5 מוביל ב-7 מתוך 9 המבחנים. GPT-6 Astra של OpenAI מוביל בשניים: AutomationBench של Zapier, שבודק תהליכים עסקיים בין אפליקציות, ו-Terminal-Bench-Science, שבודק מחקר מדעי עם קוד. מול Fable 5.1, הדגם היקר של Anthropic עצמה, Opus 5.5 מוביל בכל 9.
| Anthropic | OpenAI | ||||
|---|---|---|---|---|---|
| מבחן | Opus 5.5 | Fable 5.1 | Opus 5 | GPT-6 Astra | GPT-5.6 Sol |
| קוד | |||||
| Terminal-Bench 4.0משימות מקצועיות בשורת הפקודה | 66.4%, הגבוה בשורה | 55.8% | 52.3% | 57.9% | 37.3% |
| FrontierCode v1.1שינויי קוד שהיו מתקבלים לפרויקט | 54.4%, הגבוה בשורה | 50.3% | 48.0% | 53.3% | 47.5% |
| CursorBench 4.0משימות קוד אמיתיות מתוך Cursor | 57.8%, הגבוה בשורה | 51.8% | 46.6% | אין נתון | 41.7% |
| עבודה משרדית | |||||
| GDPval-AA v2.1עבודה מקצועית ב-44 מקצועות, ציון Elo | 1846, הגבוה בשורה | 1735 | 1708 | 1542 | 1588 |
| AutomationBenchתהליכים עסקיים בין אפליקציות, של Zapier | 40.0% | 31.4% | 26.9% | 41.4%, הגבוה בשורה | 28.8% |
| ידע ומחקר | |||||
| Humanity's Last Examשאלות קשות מכל התחומים, עם כלים | 67.7%, הגבוה בשורה | 65.6% | 63.6% | 57.2% | אין נתון |
| Terminal-Bench-Science 0.1מחקר מדעי עם קוד וכלים | 58.7% | 52.6% | 29.0% | 64.6%, הגבוה בשורה | 22.4% |
| מחשב וגרפים | |||||
| OSWorld 2.0הפעלת מחשב, ציון חלקי | 81.8%, הגבוה בשורה | 80.7% | 74.0% | אין נתון | אין נתון |
| Chartographyקריאת נתונים מגרפים, עם כלים | 89.0%, הגבוה בשורה | 88.4% | 83.4% | אין נתון | אין נתון |
מקור: הטבלה בהכרזה של Anthropic, 22.9.2026. התוצאות של Opus 5.5 במאמץ max, חוץ מ-Terminal-Bench 4.0 (xhigh). הכתר מסמן את הציון הגבוה בכל שורה, והפס את הציון ביחס אליו. את הציונים של GPT-6 Astra ו-GPT-5.6 Sol ב-Terminal-Bench מסרה OpenAI, ואת AutomationBench הריצה Zapier. "אין נתון": החברה לא פרסמה תוצאה.
אותו מבחן, מספרים אחרים
כל חברה מריצה את המבחנים בהגדרות שלה, והמספרים לא תמיד מסתדרים. בטבלה ש-OpenAI פרסמה עם ההשקה של GPT-6 Astra, Opus 5 קיבל 53.4% ב-FrontierCode. בטבלה של Anthropic, אותו דגם באותו מבחן קיבל 48.0%. ב-AutomationBench, GPT-5.6 Sol מקבל 28.8% אצל Anthropic (לפי הדירוג של Zapier) ו-18.1% אצל OpenAI עצמה. גם Anthropic כותבת שברמה הזו הפערים במבחנים משקפים פחות טוב את ההבדל בעבודה אמיתית, ושבשימוש שלה הפער בין Opus 5.5 ל-Fable 5.1 קטן ממה שהמספרים מראים.
כמה זה עולה, מול כל הדגמים
במחיר לטוקן, Opus 5.5 עולה בדיוק כמו GPT-5.6 Sol במחיר המבצע שלו, ופחות מחצי מ-GPT-6 Astra ומ-Fable 5.1. הטבלה כוללת גם את שאר דגמי Claude ואת Gemini 3.8 Flash, ש-Google השיקה ב-2 בספטמבר.
| דגם | קלט | פלט | מטמון | הקשר | תשובה מרבית |
|---|---|---|---|---|---|
| Claude | |||||
| Claude Opus 5.5נקודת הפתיחה ש-Anthropic ממליצה עליה לרוב העבודה | $4 | $20 | $0.20 | 1M | 128K |
| Claude Fable 5.1החזק ביותר, לחשיבה קשה ולמשימות ארוכות | $10 | $50 | $0.25 | 1M | 128K |
| Claude Opus 5הדגם הקודם, עדיין זמין | $5 | $25 | $0.50 | 1M | 128K |
| Claude Sonnet 5מהיר וזול יותר, קרוב ל-Opus בקוד | $2 | $10 | $0.20 | 1M | 128K |
| Claude Haiku 4.5המהיר והזול במשפחה | $1 | $5 | $0.10 | 200K | 64K |
| OpenAI ו-Google | |||||
| GPT-6 AstraOpenAI, הדגם החדש שלה מ-3 בספטמבר | $10 | $50 | $1.00 | 1.05M | 128K |
| GPT-5.6 SolOpenAI, במחיר מבצע | $4 | $20 | $0.40 | 1.05M | 128K |
| Gemini 3.8 FlashGoogle, דגם מהיר במחיר השקה | $0.75 | $3.75 | $0.075 | 1M | 64K |
דולרים למיליון טוקנים ב-API, בתעריף הרגיל, נכון ל-22.9.2026. GPT-5.6 Sol במחיר מבצע לפחות עד 21.11.2026. Gemini 3.8 Flash במחיר השקה עד 31.12.2026, ואחר כך 1.50 דולר ו-7.50 דולר. בפרומפטים ארוכים מאוד חלק מהספקים גובים תעריף גבוה יותר.
המחיר לטוקן הוא רק חלק מהחשבון. בעבודה של סוכנים ובקוד, רוב העלות מגיעה מקריאות חוזרות של אותו הקשר מהמטמון (cache), ושם Opus 5.5 זול ב-60% מ-Opus 5. מי שמריץ עבודה לא דחופה דרך ה-Batch API משלם חצי, 2 דולר ו-10 דולר. יש גם מצב מהיר (fast mode) ב-Claude Code וב-API, עד פי 2.5 מהירות, ב-8 דולר ו-40 דולר.
Gemini 3.8 Flash זול בהרבה מכל השאר, אבל זה דגם Flash, שנבנה למהירות ולחיסכון. בטבלה של OpenAI הוא קיבל 19.1% ב-Terminal-Bench 4.0. דגם ה-Pro של Google, Gemini 3.1 Pro, לא התעדכן מאז פברואר ועדיין מוגדר preview.
מה זה אומר למנויים של Claude
מנויי Pro, Max, Team ו-Enterprise יכולים לבחור ב-Opus 5.5 כבר עכשיו, בלי שינוי במחיר המנוי. יחד עם ההשקה Anthropic הגדילה באותם מסלולים את המכסה שמתאפסת כל חמש שעות (ב-Enterprise, רק במנויים לפי מושבים), בלי לפרט בכמה. כל מנוי מקבל גם איפוס מכסה אחד שאפשר לשמור ולהפעיל כשצריך.
ב-API, Opus 5 נשאר זמין. מי שמריץ תהליכי עבודה קבועים יכול להשוות בין השניים על אותן משימות לפני שהוא עובר.
למפתחים: 4 שינויים ששוברים קוד קיים
מי שעובר מ-Opus 5 צריך לעדכן את מזהה הדגם, שהוא עכשיו claude-opus-5-5, ולבדוק את הנקודות האלה (הפירוט המלא בתיעוד של Anthropic):
- אי אפשר לכבות את החשיבה. בקשה עם
thinking: {type: "disabled"}או עםbudget_tokensמחזירה שגיאת 400. שולטים בעומק החשיבה רק דרךeffort, וברירת המחדל שלו כאן היאmediumולאhigh. - אי אפשר לכפות שימוש בכלי.
tool_choiceמסוגanyאוtoolמחזיר 400. במקומו משתמשים באפשרותautoעםstrict: true, וכותבים בהנחיה מתי להשתמש בכלי. - בלוקי החשיבה קשורים לדגם ולשיחה. בחשבונות API שנפתחו מ-31 באוגוסט 2026, מי שמשנה הנחיית מערכת, כלים או הודעה קודמת בשיחה ואז שולח שוב בלוק חשיבה מקבל שגיאה. Anthropic מציגה את זה כהגנה מפני העתקת יכולות של המודל (distillation).
- שימוש במחשב רק דרך ה-toolset החדש. ב-API וב-Google Cloud הכלי הישן
computer_20251124נדחה, וצריך לעבור לכלי החדש,computer_toolset_20260801.
שינוי נוסף לא שובר בקשות, אבל יכול להשתיק ממשק: ההערות שהמודל כותב בין קריאות לכלים מגיעות עכשיו בבלוקי thinking, שריקים בהגדרת ברירת המחדל. מי שמציג אותן למשתמשים צריך לשנות את thinking.display כך שיחזיר אותן.
בטיחות: מה השתפר, ועל מה Anthropic מזהירה
זו ההשקה הראשונה של Anthropic מאז שדריו עמודיי קרא להאט את קצב הפיתוח בחזית התחום (יש באתר פוסט נפרד מ-13 בספטמבר על המאמר). לפני ההשקה המודל עבר גם בדיקות של גופים חיצוניים, בהם METR ו-Frontier Design. במבחן ההתנהגות האוטומטי של החברה, שמריץ כמעט 2,000 תרחישים, הוא קיבל את הציונים הטובים ביותר שמדדה עד היום.
בניסוי חדש שבודק נטייה לחצות גבולות שהוצבו למודל, Opus 5.5 ניסה לעשות את זה בכ-85% פחות מקרים מ-Opus 5 ומ-Claude Mythos 5.1. כל הניסיונות היו בחומרה נמוכה, והוא עצמו דיווח עליהם. מול prompt injection, הוראות זדוניות שמוסתרות בתוך אתרים ומסמכים, הוא עמיד לפחות כמו Opus 5 בכל סביבה שנבדקה, ובמבחן של חברת האבטחה Gray Swan הוא חולק עם Fable 5.1 את שיעור ההצלחה הנמוך ביותר של התקפות.
לפני שמדביקים לו טקסט
לפי כרטיס המערכת, Opus 5.5 נוטה יותר מ-Opus 5 לבצע הוראות שמישהו אחר הטמין בטקסט שהמשתמש עצמו מדביק להנחיה, למשל בקובץ README, במייל או בתוכן מאתר. גם הוראות שכתובות בתווים שלא רואים על המסך נכללות בזה. בגרסאות מוקדמות של המודל זה קרה בכ-52% מהניסיונות במבחן קוד. אחרי תיקון באימון, הגרסה שהושקה ביצעה את ההוראות בכ-2% מהניסיונות ברמת המאמץ הרגילה ובכ-7.4% ברמה המקסימלית. Opus 5 לא ביצע אותן אף פעם. Anthropic מוסיפה למוצרים שלה הגנות שמסירות תווים בלתי נראים ומסמנות טקסט מודבק, ועם ההגנות האלה המודל לא ביצע אף אחת מההוראות במבחן. בכל מקרה, כדאי לעבור קודם על טקסט שלא כתבתם לפני שמדביקים אותו, במיוחד כשהמודל יכול לבצע פעולות בעצמו, כמו ב-Claude Code. באותו מסמך Anthropic מציינת שהוא גם מקבל לעיתים קרובות יותר טענות על הרשאות שאי אפשר לאמת.
בגלל היכולות שלו בביולוגיה ובסייבר, Anthropic משיקה אותו עם הגנות דומות לאלה של Fable 5.1. תיקון באגים בקוד שלכם עובד כרגיל, אבל רוב משימות אבטחת הסייבר מועברות אוטומטית ל-Opus 4.8. ארגוני מחקר בביולוגיה יכולים להגיש בקשה לתוכנית Life Sciences Verification כדי לקבל גישה רחבה יותר, ותוכנית מקבילה לאנשי אבטחה תורחב אליו בשבועות הקרובים. כמו Fable 5.1, גם Opus 5.5 מסמן את הטקסט שהוא כותב בסימן מים שנועד לעמוד בחוק ה-AI האירופי (יש על זה פוסט נפרד מאוגוסט).
Anthropic גם כותבת בגלוי שהמודל חושד לעיתים קרובות שהוא נמצא בבדיקה, ושזה מקשה להעריך איך הוא יתנהג בשימוש אמיתי.
מה עוד בדרך
Opus 5.5 הוא הראשון במשפחה. לפי Anthropic, Sonnet 5.5 ו-Haiku 5.5 יגיעו בשבועות הקרובים עם חלק גדול מאותם שיפורים בביצועים, ביעילות ובבטיחות. תאריך מדויק עוד אין.
שאלות נפוצות
האם Opus 5.5 זמין במנוי החינמי?
לא. ב-Claude הוא זמין למנויי Pro, Max, Team ו-Enterprise. המנוי החינמי כולל את דגמי Sonnet ו-Haiku.
כמה עולה Opus 5.5 ב-API?
4 דולר למיליון טוקנים נכנסים ו-20 דולר למיליון יוצאים, 20% פחות מ-Opus 5. קריאה מהמטמון עולה 0.20 דולר למיליון, ב-Batch API המחיר חצי (2 דולר ו-10 דולר), ובמצב מהיר 8 דולר ו-40 דולר.
האם הוא טוב יותר מ-Fable 5.1?
בטבלה של Anthropic הוא מוביל בכל 9 המבחנים, בעלות נמוכה בהרבה. Anthropic עצמה כותבת שבשימוש שלה הפער קטן ממה שהמספרים מראים, וממליצה על Fable 5.1 לחשיבה הקשה ביותר ולמשימות ארוכות, או כשגם Opus 5.5 ברמת מאמץ גבוהה לא מספיק.
איך הוא מול GPT-6 Astra?
בטבלה של Anthropic יש 6 מבחנים עם תוצאות לשניהם. Opus 5.5 מוביל ב-4 מהם, ו-GPT-6 Astra מוביל ב-AutomationBench וב-Terminal-Bench-Science. במחיר, Astra עולה 10 דולר ו-50 דולר למיליון טוקנים, פי 2.5 מ-Opus 5.5.
אפשר לכבות את החשיבה כדי לקבל תשובה מהירה?
לא. ב-Opus 5.5 החשיבה תמיד פעילה. כדי לקצר אותה מורידים את רמת המאמץ ל-low, וזה מוריד גם את העלות ואת זמן התגובה.
מתי יגיעו Sonnet 5.5 ו-Haiku 5.5?
לפי Anthropic, בשבועות הקרובים. תאריך מדויק עוד אין.
השורה התחתונה
Anthropic עצמה ממליצה עכשיו להתחיל מ-Opus 5.5 ברוב העבודה, ולעבור ל-Fable 5.1 רק כשהוא לא מספיק גם ברמת מאמץ גבוהה. מי שמשתמש ב-Claude במנוי מקבל את הדגם החדש בלי תוספת תשלום, ומי שמשלם לפי טוקנים אמור לשלם כ-40% פחות על אותה עבודה. כדאי לבדוק את זה על המשימות הקבועות שלכם לפני שמעבירים את כולן.
ההכרזה הרשמית של Anthropicanthropic.comעוד באתר: ההשקה של Claude Opus 5, GPT-6 Astra של OpenAI, וגם Claude Sonnet 5.
הירשמו לעדכונים במייל
רוצים להישאר צעד אחד קדימה?
עדכונים על כלי AI, מדריכים וטיפים - ישר למייל. בלי ספאם.
