שש רמות מאמץ, משימה אחת: מה באמת משתנה ב-Opus 5.5
רמת המאמץ היא אחת ההגדרות הכי פחות מובנות בעבודה עם מודלים. היא נראית כמו כפתור של "יותר טוב", אבל בפועל היא קובעת כמה זמן הסוכן יחשוב, כמה בדיקות יריץ וכמה תשלמו. הניתוח הזה עובר על ניסוי שבו Opus 5.5 קיבל את אותה משימה בדיוק בשש רמות מאמץ, ובודק מה השתנה בזמן, בעלות, במספר הבדיקות ובאיכות, ולמה הרמה היקרה ביותר לא ניצחה.
למה בכלל להשוות רמות מאמץ על אותה משימה?
כמעט כל מי שעובד עם Opus 5.5 פוגש את השאלה הזאת: איזו רמת מאמץ לבחור. יש שש אפשרויות, low, medium, high, extra, max, ו-ultracode, והאינטואיציה אומרת שככל שעולים ברמה התוצאה משתפרת. זה נכון רק בחלקו. רמת מאמץ גבוהה יותר פירושה שהמודל חושב יותר לפני כל צעד, מריץ יותר בדיקות, וצורך הרבה יותר טוקנים. כל אלה עולים כסף וזמן, והשאלה האמיתית היא אם התוצאה משתפרת באותו קצב.
כדי לענות על זה צריך ניסוי הוגן: אותו פרומפט, אותה תיקיית קבצים, אותה סביבה, ורק רמת המאמץ משתנה. בהדגמה שהניתוח הזה מתבסס עליה, זה בדיוק מה שנעשה. כל אחת משש הרמות קיבלה משימה גדולה ופתוחה, רצה לבד מההתחלה ועד הסוף בלי התערבות, ובסוף נמדדו חמישה דברים: כמה זמן היא רצה, כמה הייתה עולה לפי תמחור API, כמה טוקנים צרכה, כמה בדיקות הריצה בדפדפן, וכמה שאלות שאלה בדרך.
התוצאות לא היו צפויות. העלות והזמן אמנם עלו כמעט באופן קבוע עם הרמה, אבל האיכות לא. הרמה שנבחרה כמנצחת הייתה extra, ולא max, והרמה היקרה ביותר הפיקה עולם עם באגים בולטים יותר משתי הרמות שמתחתיה. הניתוח שלהלן עובר על כל רמה, על המספרים, ועל מה שאפשר ללמוד מהם כשבוחרים רמת מאמץ למשימות אמיתיות, בפיתוח וגם בעבודת ידע.
שש רמות המאמץ במבט אחד
לפני שנכנסים לפרטים, כך נראו שש הריצות זו לצד זו. המספרים מחושבים לפי תמחור API, גם אם בפועל הריצות נעשו במסגרת מנוי. שימו לב שהעלות והזמן לא תמיד עולים יחד, ושהרמה עם הכי הרבה בדיקות היא לא הרמה עם התוצאה הטובה ביותר. הכרטיסים מסכמים את הזמן, העלות ואת מה שבלט בתוצאה של כל רמה.
low
- כ-17 דקות ריצה, 3.91 דולר.
- 22 בדיקות, אפס שאלות.
- עולם בסיסי, בלי מיתוג ועם דמויות שנעלמות.
medium
- שעה ו-13 דקות, 12.44 דולר.
- 23 בדיקות, אפס שאלות.
- מיתוג נכון, סרטונים מתנגנים, קפיצה גדולה באיכות.
high
- שעה ו-7 דקות, 16.31 דולר.
- 22 בדיקות, השאלה היחידה בכל הניסוי.
- החוויה החלקה ביותר, עם כתוביות ודלתות אוטומטיות.
extra
- שעה וחצי, 25.92 דולר.
- 34 בדיקות, אפס שאלות.
- המנצחת: אפשר לשבת, לדבר עם דמויות ולהשתתף.
max
- שעתיים ו-28 דקות, 50.38 דולר.
- 51 בדיקות ודחיסת הקשר אחת.
- הליכה מגושמת, צללים קופצים ובאגים.
ultracode
- שעה ו-35 דקות, 18.69 דולר.
- 42 בדיקות, אפס שאלות.
- מרשים, אבל בלי התהליכים המקביליים שהיו אמורים לרוץ.
איך נבנה הניסוי ומה הייתה המשימה?
המשימה נבחרה כך שתהיה קשה באמת. הסוכן קיבל תיקייה עם כ-105 ג'יגה של הקלטות מכנס וירטואלי שהתקיים בעבר, והתבקש להפוך אותו לעולם תלת-ממדי שאפשר להסתובב בו בגוף שלישי, כאילו הייתם בכנס פיזי אמיתי: חדרים שונים, מסלולים שונים, במות, דוכנים ואזור VIP. הוא קיבל גישה לכלי יצירת תמונות ווידאו ולשאר הקבצים בפרויקט, והוסבר לו מראש שהתוצאה תיבחן לפי יצירתיות, עיצוב, פיזיקה ותחושה כללית של המקום.
זו משימה שמאתגרת בכל הכיוונים בבת אחת. היא דורשת לעבור על הרבה חומר ולהבין מה יש בו, להמציא סיפור ומבנה, לכתוב הרבה קוד, ולבדוק את התוצאה בדפדפן שוב ושוב. היא גם פתוחה מספיק כדי שכל רמה תוכל לפרש אותה אחרת, ולכן היא מבחן טוב לשאלה מה בדיוק מקבלים כשמשלמים על עוד חשיבה. מבנה הפרומפט נראה בערך כך:
/goal Build a realistic 3D tech-conference world I can walk around
in third-person view.
Source material: ./event-recordings/ (all sessions, booths, keynotes)
Make it feel like attending in person: rooms, tracks, stages, expo, VIP.
You may use the image and video tools available in this project.
You will be judged on: creativity, design, physics, overall feel.הפרומפט הורץ עם הפקודה /goal, כלומר הסוכן עבד בלולאה עד שהחליט שהמשימה הושלמה, בלי שמישהו אישר או תיקן בדרך. כל רמה רצה בשיחה משלה, מאפס, עם אותה תיקייה. זה חשוב, כי זה מבטל את האפשרות שרמה אחת נהנתה מעבודה של רמה קודמת. ההבדלים בתוצאה נובעים מרמת המאמץ בלבד, וגם מהאקראיות הטבעית של המודל, שעליה נדבר בהמשך.
מה בדיוק נמדד בכל ריצה
חמישה מדדים נאספו מכל ריצה: זמן ריצה כולל, עלות משוערת לפי תמחור API, סך הטוקנים שנצרכו בשיחה, מספר הבדיקות שהסוכן הריץ בדפדפן כדי לוודא שהעולם עובד, ומספר השאלות שהוא עצר לשאול. בנוסף, כל עולם נבחן ידנית: הליכה בכל החדרים, בדיקה אם הסרטונים מתנגנים באמת, אם הדמויות מתנהגות כמו שצריך, ואם יש באגים של קירות, צללים או תנועה.
איך נראו התוצאות, רמה אחרי רמה?
המעבר על שש התוצאות לפי הסדר מראה דפוס ברור בחצי הראשון, ושבירה של הדפוס בחצי השני. כדאי לשים לב במיוחד לפערים בין רמות סמוכות, כי שם מתקבלת ההחלטה האמיתית: לא בין low ל-max, אלא בין medium ל-high, או בין extra ל-max.
רמה 1, low: עולם שעובד, בלי נשמה
אחרי 16 דקות ו-43 שניות התקבל עולם שאפשר להסתובב בו, עם מפה, לובי, אולם תצוגה, טרקלין VIP ובמה ראשית. הסוכן גם מצא את סדר היום של הכנס ואת הדוכנים האמיתיים. אבל המיתוג לא היה נכון, לא הלוגו ולא הצבעים, התאורה הייתה בהירה מדי, הדמויות נעלמו כשמתקרבים אליהן, ובחדרי ההרצאות הוצגו תמונות סטטיות במקום סרטונים. זו תוצאה של טיוטה ראשונה, לא של מוצר.
רמה 2, medium: הקפיצה הגדולה ביותר
כאן האיכות קפצה. הסוכן מצא את הנחיות המותג והשתמש בהן, העולם נראה כמו הכנס האמיתי, והסרטונים בחדרים התנגנו באמת. דמויות הגיבו כשמתקרבים אליהן, מסמכי ההרצאות הוצגו על קיר משאבים, והבמה הראשית הייתה מלאה בפרטים. הריצה לקחה שעה ו-13 דקות ועלתה 12.44 דולר, פי שלושה בערך מ-low, אבל ההבדל באיכות היה גדול בהרבה מפי שלושה.
רמה 3, high: החלקה ביותר
high רצה מעט מהר יותר מ-medium ועלתה 16.31 דולר. התוצאה הייתה החלקה והנקייה ביותר: דלתות זכוכית אוטומטיות, דגלים עם שמות הדוברים, דרכון שסופר את האזורים שביקרתם בהם, צמיד VIP שצריך לאסוף כדי להיכנס, ומסיבת סיום עם עמדת תקליטן. בבמה הראשית הופיעו כתוביות חיות. זו גם הרמה היחידה בכל הניסוי ששאלה שאלה אחת בדרך. החיסרון: אי אפשר היה לשבת בהרצאות, ובמקום אחד אפשר היה לעבור דרך קיר.
רמה 4, extra: הרמה שנבחרה כמנצחת
extra רצה שעה וחצי ועלתה 25.92 דולר, עם 34 בדיקות, הכי הרבה עד אותו שלב. מה שהבדיל אותה הוא האינטראקטיביות: אפשר לשבת בכל כיסא ולצפות בהרצאה, לדבר עם דמויות שמגיבות במשפטים שקשורים לתוכן הכנס, ולהיכנס לחדרי עבודה עם דפי עבודה אמיתיים. הדמות הראשית אפילו נבנתה בדמות המשתמש. החיסרון היחיד שבלט הוא חוויית VIP דלה יותר ממה שהופיע ב-high.
רמה 5, max: יותר מכל דבר, חוץ מאיכות
max רצה שעתיים ו-28 דקות, עלתה 50.38 דולר, צרכה כ-1.18 מיליון טוקנים והגיעה לדחיסת הקשר. היא הריצה 51 בדיקות, יותר מכל רמה אחרת. ובכל זאת, ההליכה של הדמות הייתה מגושמת, הצללים קפצו, סרטון במרכז התערוכה לא התנגן, ובאזור הסדנאות העולם נשבר לגמרי. היו בה גם רעיונות יפים, כמו מדרגות נעות ודוכנים מעוצבים היטב, אבל ההתרשמות הכללית הייתה חלשה משתי הרמות שמתחתיה.
רמה 6, ultracode: מרשימה, אבל לא מה שהובטח
ultracode רצה שעה ו-35 דקות ועלתה 18.69 דולר, זול בהרבה מ-extra ומ-max. התוצאה הרגישה מושקעת: הליכה טבעית, מפה ברורה, משימות שמנחות את המשתמש, ספריית משאבים שאפשר לפתוח, ועמדת צילום ששומרת תמונה. אבל לא ניתן היה לשבת או לדבר עם דמויות, והיו קטעים שבהם התנועה נתקעה. והחשוב מכול: מה שהיה אמור לייחד את הרמה הזאת בכלל לא הופעל.
מה המספרים מלמדים על עלות מול איכות?
כשמסדרים את שש הריצות בטבלה, העלות והזמן מתנהגים כמעט כמו שמצפים: ככל שהרמה עולה, הסוכן חושב יותר, צורך יותר טוקנים, ומשלמים יותר. הריצה היקרה ביותר עלתה פי 12.9 מהזולה ביותר, ומספר הבדיקות ב-max היה פי 2.3 מ-low. סך הכול, שש הריצות יחד היו עולות כ-127 דולר לפי תמחור API. אלה הנתונים הגולמיים של הניסוי, בפורמט שקל להעתיק לגיליון ולהשוות לניסויים שלכם:
level,runtime,cost_usd,checks,questions
low,0:16:43,3.91,22,0
medium,1:13,12.44,23,0
high,1:07,16.31,22,1
extra,1:30,25.92,34,0
max,2:28,50.38,51,0
ultracode,1:35,18.69,42,0הדבר שהמספרים לא מראים הוא האיכות, ושם הקו כבר לא ישר. הקפיצה מ-low ל-medium הייתה הגדולה ביותר, והיא עלתה בערך 8.5 דולר. הקפיצה מ-medium ל-high ומשם ל-extra המשיכה לשפר, בעיקר בפרטים ובאינטראקטיביות. ואז, במעבר ל-max, העלות כמעט הוכפלה והאיכות ירדה. זה נראה כמו תשואה פוחתת קלאסית: כל שקל נוסף קונה פחות שיפור, ומנקודה מסוימת הוא כבר לא קונה שיפור בכלל.
יש גם חריגה אחת מעניינת בזמנים. high רצה מהר יותר מ-medium, למרות שצרכה יותר טוקנים ועלתה יותר. ההסבר הסביר הוא שחשיבה טובה יותר בתחילת הדרך חוסכת צעדים מבוזבזים אחר כך: הסוכן שמתכנן טוב יותר עושה פחות סבבים של ניסוי וטעייה. במילים אחרות, זמן ריצה ועלות הם לא אותו דבר, ורמה גבוהה יותר לא בהכרח אומרת שתחכו יותר.
למה הרמה היקרה ביותר לא ניצחה?
התוצאה של max נראית בהתחלה כמו פרדוקס: יותר חשיבה, יותר בדיקות, יותר זמן, ותוצאה חלשה יותר. אבל כשמסתכלים על מה שקרה בתוך הריצה, יש לזה כמה הסברים סבירים. הראשון הוא דחיסת ההקשר. max צרכה כ-1.18 מיליון טוקנים, יותר מגודל חלון ההקשר, ולכן בשלב מסוים השיחה נדחסה אוטומטית. דחיסה כזאת מסכמת את מה שקרה עד אותו רגע, ובסיכום הולכים לאיבוד פרטים: החלטות עיצוב, תיקונים שכבר נעשו, והבנה של איך חלקי הקוד מתחברים.
ההסבר השני הוא שמספר בדיקות גבוה לא מבטיח בדיקות טובות. 51 בדיקות נשמע מרשים, אבל העולם עדיין יצא עם הליכה מגושמת ועם אזור שלם שנשבר. בדיקה שווה רק כמו השאלה שהיא שואלת: אם הסוכן בודק שהדף נטען ושאין שגיאות, הוא לא יגלה שההליכה מרגישה רע או שהצללים קופצים. זה בדיוק ההבדל בין לבדוק הרבה לבין לבדוק נכון, ובין סוכן שמצהיר שסיים לבין סוכן שהוכיח את זה, כמו שדורש סקיל האימות לפני הכרזה על סיום.
ההסבר השלישי הוא פשוט אקראיות. כל ריצה של מודל שפה היא דגימה אחת מתוך הרבה תוצאות אפשריות, ובמשימה פתוחה כמו בניית עולם תלת-ממדי הפיזור גדול. ייתכן שריצה נוספת של max הייתה יוצאת טובה יותר, וייתכן שריצה נוספת של extra הייתה יוצאת חלשה יותר. ניסוי עם ריצה אחת לכל רמה נותן כיוון, לא הוכחה. ובכל זאת, הכיוון עקבי עם מה שרואים בהרבה משימות: מעבר לנקודה מסוימת, עוד חשיבה לא מוסיפה איכות.
הערך האמיתי של extra
extra עלתה בערך חצי מ-max ורצה בערך חצי מהזמן, והתוצאה שלה נבחרה כנקודת ההתחלה הטובה ביותר להמשך עבודה. זה הלקח המעשי: הרמה הנכונה היא לא זו שנותנת את התוצאה המרשימה ביותר בריצה אחת, אלא זו שנותנת בסיס טוב להמשיך ממנו במחיר סביר. high, למשל, הייתה כנראה מגיעה לאותו מקום עם עוד פרומפט או שניים.
מה קרה עם ultracode ולמה אף רמה לא האצילה עבודה?
ultracode היא לא באמת רמת מאמץ נפרדת. מתחת למכסה היא משתמשת ברמת extra, ומוסיפה עליה נטייה להפעיל תהליכים דינמיים, כלומר לפצל את העבודה להרבה סוכנים שרצים במקביל לפי תוכנית, ולאחד את התוצאות בסוף. זה גם מסביר למה בגרפים של הניסוי היא התנהגה כמו extra מבחינת עלות וזמן. ההבטחה היא שמשימה גדולה תתפרק לחלקים שכל אחד מהם מקבל תשומת לב מלאה, במקום שסוכן אחד ינסה להחזיק הכול בראש.
בפועל, במעבר על יומני השיחה, התברר שהתהליכים הדינמיים לא הופעלו בכלל. הריצה עשתה יותר בדיקות מרוב הרמות, 42 במספר, אבל עבדה כסוכן אחד. זה חזר גם בניסיונות נוספים, ולכן לא ברור אם מדובר בבאג זמני בכלי או בהתנהגות של Opus 5.5 עם המצב הזה. מי שרוצה להבין מתי פיצול כזה באמת מועיל, ומתי הוא רק מכפיל את העלות, ימצא הסבר מפורט בניתוח על תהליכים דינמיים עם עשרות סוכנים במקביל.
ממצא נוסף, שחל על כל שש הרמות: אף אחת מהן לא הפעילה תת-סוכן. גם max, שהגיעה לדחיסת הקשר ושהייתה מרוויחה מאוד מהעברת חלק מהעבודה לסוכנים אחרים, בחרה לעשות הכול בעצמה. זה לא בהכרח רע. בהגדרות Claude Code שלי, למשל, אין ריבוי סוכנים בלי בקשה מפורשת, כי ברוב המשימות סוכן אחד עם הקשר מלא עובד טוב יותר וזול יותר. אבל זה אומר שאם אתם רוצים פיצול, צריך לבקש אותו במפורש ולא לסמוך על רמת המאמץ שתעשה את זה לבד.
איך בוחרים רמת מאמץ למשימה שלכם?
ההמלצה הרשמית של Anthropic להנחיית Opus 5.5 פשוטה: להתחיל ב-medium, ולהעלות או להוריד לפי הצורך. הניסוי תומך בזה. medium נתנה את הקפיצה הגדולה ביותר ביחס למחיר, ולרוב עבודת הידע, כתיבה, מחקר, סיכומים ואוטומציות קטנות, היא מספיקה לגמרי. low מתאימה למשימות קצרות ומוגדרות היטב, שבהן אתם יודעים בדיוק מה אתם רוצים ורק צריכים ביצוע מהיר, כמו שינוי קטן בקוד או המרה של קובץ.
high ו-extra שמורות למשימות שדורשות הרבה הסקה: לעבור על כמויות גדולות של חומר, לבנות משהו מורכב מאפס, או לרוץ לבד לאורך זמן בלי שמישהו יתקן בדרך. במשימה של הניסוי, שבה הסוכן היה צריך לעבור על עשרות סרטונים, למצוא חומרים בפרויקט, ולבנות מהם חוויה עם סיפור, extra הצדיקה את המחיר. במשימה שבה אתם נמצאים ליד המקלדת ויכולים לתקן אחרי כל סבב, high עם עוד פרומפט אחד או שניים תגיע כנראה לאותו מקום בפחות כסף.
max כדאי להשאיר למקרים נדירים, ורצוי לבדוק מראש אם המשימה בכלל נכנסת בחלון ההקשר. אם הריצה צפויה לחרוג ממנו, עדיף לפצל את המשימה לשלבים, או לבקש במפורש עבודה עם תתי-סוכנים, מאשר לשלם על עוד חשיבה שתלך לאיבוד בדחיסה. ומי שעובד עם הכלי באופן יומיומי יכול למצוא סקירה רחבה יותר של היכולות והמגבלות שלו בסקירת הכלי Claude Code.
כלל אצבע שעולה מהניסוי: תבחרו את הרמה לפי שתי שאלות. כמה הסקה המשימה דורשת, וכמה פעמים תוכלו להתערב באמצע. משימה קלה עם הרבה התערבות מתאימה לרמה נמוכה. משימה קשה שרצה לבד מתאימה לרמה גבוהה. ובכל מקרה, אם אתם לא בטוחים, תריצו את אותה משימה פעמיים ברמות סמוכות ותשוו. זה עולה מעט, ומלמד הרבה יותר מכל טבלה כללית.
מתי שווה להעלות את רמת המאמץ, ומתי לא?
הרשימות הבאות מסכמות את הסימנים שמצביעים על כך שכדאי לשלם על עוד חשיבה, ואת הסימנים שמראים שרמה נמוכה יותר תספיק. הן מבוססות על מה שקרה בניסוי, ועל ההיגיון של תשואה פוחתת: כל רמה נוספת עולה יותר, והשיפור שהיא קונה הולך וקטן ככל שעולים.
שווה להעלות
- הסוכן צריך לעבור על הרבה חומר לפני שהוא מתחיל.
- המשימה פתוחה ודורשת תכנון ושיקול דעת.
- הריצה תתבצע בלי השגחה, למשל עם /goal.
- טעות בכיוון תעלה יותר מהפרש המחיר.
- הרמה הנוכחית כבר נכשלה באותה משימה.
רמה נמוכה תספיק
- המשימה קצרה ויש לה תשובה ברורה.
- אתם זמינים לתקן אחרי כל סבב.
- הריצה עלולה לחרוג מחלון ההקשר.
- העלות לכל ריצה חשובה, למשל בסוכן שרץ אלפי פעמים.
- medium כבר נותנת תוצאה טובה מספיק.
חמש תובנות על רמות מאמץ
הקפיצה הגדולה היא בהתחלה
המעבר מ-low ל-medium קנה את השיפור הגדול ביותר בניסוי, בתוספת של כ-8.5 דולר בלבד. אחרי זה כל רמה נוספת הוסיפה פחות, ומעבר ל-extra השיפור כבר נעצר ואפילו התהפך.
יקר יותר לא אומר טוב יותר
max עלתה כמעט פי שניים מ-extra והפיקה תוצאה חלשה יותר, עם באגים בולטים. דחיסת הקשר ואקראיות של ריצה בודדת יכולות למחוק את היתרון של עוד חשיבה.
הרבה בדיקות הן לא בדיקות טובות
51 בדיקות לא מנעו הליכה מגושמת ואזור שנשבר. מה שקובע הוא מה הבדיקה בודקת, לא כמה פעמים היא רצה. בדיקה של חוויה צריכה להיות מוגדרת במפורש.
זמן ועלות הם שני מדדים שונים
high רצה מהר יותר מ-medium למרות שעלתה יותר. תכנון טוב יותר בתחילת הדרך חוסך סבבים מבוזבזים, ולכן רמה גבוהה לא תמיד אומרת לחכות יותר.
פיצול לא קורה מעצמו
אף רמה לא הפעילה תת-סוכן, ו-ultracode לא הפעילה את התהליכים המקביליים שלה. אם אתם רוצים שהעבודה תתחלק בין סוכנים, צריך לבקש את זה במפורש בפרומפט.
סיכום: איזו רמת מאמץ לבחור?
הניסוי מראה שרמת מאמץ היא החלטה כלכלית, לא רק טכנית. medium היא נקודת התחלה טובה לרוב העבודה, ו-extra היא הבחירה המשתלמת למשימות גדולות שרצות לבד. max כמעט אף פעם לא מצדיקה את המחיר הכפול, ו-ultracode כדאי לבדוק מחדש בכל פעם, כי ההתנהגות שלה עדיין לא יציבה. הדרך הכי טובה לבחור היא להריץ את המשימה האמיתית שלכם בשתי רמות סמוכות, להשוות את התוצאה ואת החשבון, ולהחליט לפי מה שיצא.
אותה שאלה חוזרת בכל מערכת AI שרצה בייצור. למשל, בסוכן שירות לקוחות מבוסס בינה מלאכותית כל שיחה מפעילה את המודל מחדש, ולכן ההבדל בין רמת מאמץ נמוכה לגבוהה מוכפל באלפי שיחות בחודש. ברוב השאלות של לקוחות רמה נמוכה או בינונית מספיקה לגמרי, ורמה גבוהה שמורה למקרים מורכבים שבהם טעות עולה ביוקר.
מי שרוצה לבנות סוכנים ואוטומציות שמאזנים נכון בין איכות לעלות, ולבחור לכל משימה את המודל ואת רמת המאמץ שמתאימים לה, מוזמן לקבוע איתי שיחה ולבדוק ביחד מאיפה נכון להתחיל.
שיתוף הפוסט
שאלות ותשובות
מה זו רמת מאמץ ב-Opus 5.5?
רמת מאמץ היא הגדרה שקובעת כמה המודל יחשוב לפני שהוא עונה או פועל. ברמה נמוכה הוא עונה מהר ובקצרה, וברמה גבוהה הוא מתכנן יותר, בודק יותר ומנסה יותר כיוונים לפני שהוא מתקדם. יש שש רמות: low, medium, high, extra, max, ו-ultracode. ככל שהרמה עולה, צריכת הטוקנים, הזמן והעלות עולים, אבל האיכות לא תמיד עולה באותו קצב, ולכן כדאי לבחור אותה לפי המשימה.
איזו רמת מאמץ כדאי לבחור כברירת מחדל?
ההמלצה של Anthropic היא להתחיל ב-medium ולהעלות או להוריד לפי הצורך, והניסוי תומך בזה. medium נתנה את הקפיצה הגדולה ביותר באיכות ביחס למחיר, והיא מספיקה לרוב עבודת הידע, הכתיבה והמחקר. כדאי לעלות לרמה גבוהה יותר רק כשהמשימה דורשת הרבה הסקה, או כשהסוכן ירוץ לבד לאורך זמן בלי שתוכלו לתקן אותו בדרך, ושם הפרש המחיר מצדיק את עצמו.
למה max הפיקה תוצאה חלשה יותר מ-extra?
יש כמה הסברים אפשריים. הריצה של max צרכה יותר טוקנים מגודל חלון ההקשר והגיעה לדחיסה, ובדחיסה הולכים לאיבוד פרטים והחלטות שכבר התקבלו. בנוסף, הרבה בדיקות לא מבטיחות שהבדיקות נכונות, ו-51 בדיקות לא תפסו בעיות של תחושה ותנועה. ולבסוף, מדובר בריצה בודדת לכל רמה, ובמשימה פתוחה האקראיות של המודל משחקת תפקיד גדול, ולכן כדאי להתייחס לתוצאה ככיוון ולא כהוכחה.
כמה עולה להריץ משימה גדולה ברמות השונות?
במשימה של הניסוי, בניית עולם תלת-ממדי מהקלטות של כנס, העלות לפי תמחור API נעה בין 3.91 דולר ב-low ל-50.38 דולר ב-max, פער של פי 12.9. medium עלתה 12.44 דולר, high עלתה 16.31, extra עלתה 25.92, ו-ultracode עלתה 18.69. מי שעובד במסגרת מנוי לא משלם את הסכומים האלה ישירות, אבל הם משקפים כמה מהמכסה נצרכת, וכמה מהר היא תיגמר.
מה ההבדל בין ultracode לבין extra?
ultracode משתמשת ברמת extra מתחת למכסה, ומוסיפה נטייה לפצל את העבודה לתהליכים דינמיים, כלומר להרבה סוכנים שעובדים במקביל ומאחדים תוצאות בסוף. בניסוי, התהליכים האלה לא הופעלו בכלל, והריצה עבדה כסוכן אחד עם יותר בדיקות. לכן כדאי לבדוק ביומני השיחה מה באמת קרה, ולא להניח שהפיצול התבצע רק כי בחרתם במצב הזה, במיוחד במשימות ארוכות ויקרות.
האם רמת מאמץ גבוהה תמיד מאריכה את זמן הריצה?
לא תמיד. בניסוי, high רצה שעה ו-7 דקות, מהר יותר מ-medium שרצה שעה ו-13 דקות, למרות שצרכה יותר טוקנים ועלתה יותר. ההסבר הסביר הוא שתכנון טוב יותר בתחילת העבודה חוסך סבבים של ניסוי וטעייה בהמשך. עם זאת, ברמות הגבוהות באמת, כמו max, זמן הריצה קפץ לשעתיים וחצי, ולכן כדאי לקחת את זה בחשבון כשמתכננים ריצה.
למה אף רמה לא השתמשה בתתי-סוכנים?
נראה שהמודל מעדיף לעבוד בעצמו כשלא מבקשים ממנו אחרת, גם ברמות הגבוהות וגם כשהוא מתקרב לגבול חלון ההקשר. זה לא בהכרח רע, כי סוכן אחד עם הקשר מלא לרוב מדויק וזול יותר מכמה סוכנים שכל אחד רואה רק חלק. אבל אם המשימה גדולה מספיק כדי להרוויח מפיצול, צריך לבקש את זה במפורש בפרומפט ולהגדיר מה כל סוכן עושה ומה הוא מחזיר.
איך בודקים בעצמי איזו רמה מתאימה למשימה שלי?
הדרך הפשוטה ביותר היא להריץ את אותה משימה אמיתית בשתי רמות סמוכות, למשל medium ו-high, עם אותו פרומפט ואותם קבצים. אחר כך משווים ארבעה דברים: איכות התוצאה, זמן הריצה, העלות או צריכת המכסה, וכמה תיקונים נדרשו אחרי זה. אם הרמה הזולה דורשת רק תיקון קטן אחד, היא כנראה הבחירה הנכונה למשימות מהסוג הזה, ואפשר לחזור על הבדיקה מדי פעם.