שבעה מבחנים בין Sonnet ל-Opus: מתי משתלם לשלם כפול?
המודל הבינוני החדש של Anthropic, Sonnet 5.5, מהיר בכשליש מהדור הקודם וזול בעד שליש, ועולה בערך חצי מ-Opus 5.5. השאלה המעשית היא לא איזה מודל חכם יותר, אלא מתי התוספת במחיר מחזירה את עצמה. הניתוח הזה עובר על שבע משימות אמיתיות שהורצו על שני המודלים עם אותו פרומפט בדיוק, עם זמני ריצה, טוקנים ועלות בדולרים, ומגיע לכלל פשוט לבחירת מודל.
האם המודל היקר באמת שווה פי שניים?
ברוב ההשוואות בין מודלים שואלים מי מנצח. זו שאלה פחות מעניינת ממה שנדמה, כי ברור ש-Opus 5.5 הוא המודל החזק יותר. השאלה שמשפיעה על החשבון החודשי שלכם היא אחרת: אם מודל אחד עולה בדיוק פי שניים מהשני, האם התוצאה שלו טובה פי שניים? ואם לא, האם אפשר להגיע לאותה תוצאה עם המודל הזול בעזרת פרומפט טוב יותר או סבב תיקון נוסף, ועדיין לשלם פחות בסך הכול?
בהדגמה שהניתוח הזה מתבסס עליה, שני המודלים קיבלו שבע משימות מעולם העבודה האמיתית: דף נחיתה עם אנימציות גלילה, סרטון תדמית מונפש, תוכנית פעולה ל-90 יום, גיליון אקסל עם מצגת למשקיעים, דף הסבר שנבנה מסקיל קיים, לוח בקרה אינטראקטיבי שאוסף חדשות, ומדריך משאבים מסרטון. כל משימה רצה על שני המודלים במקביל, עם אותו פרומפט ואותה רמת מאמץ גבוהה, והעלות נמדדה בדולרים לפי תמחור ה-API ולא לפי אחוזים מהמנוי.
הבחירה במדידה בדולרים חשובה. אחוזים ממכסת מנוי תלויים בחבילה שלכם, ולכן קשה להשוות ביניהם. דולרים לפי מיליון טוקנים הם מדד אחיד שמתורגם בקלות לכל חבילה, והעלות ביחס בין המודלים נשארת דומה גם כשעובדים דרך מנוי. בסוף הניתוח תמצאו את התוצאות של כל מבחן, את הסיכום המספרי, וכלל עבודה פשוט שאפשר ליישם כבר מחר על הסקילים והתהליכים שאתם מריצים.
מה ההמלצה הרשמית של Anthropic לכל מודל?
לפני המבחנים כדאי לראות את נקודת המוצא. יחד עם ההשקה פורסם מדריך קצר שמחלק את העבודה בין שני המודלים. ארבע הקטגוריות הראשונות מיועדות ל-Sonnet 5.5, ושתי האחרונות ל-Opus 5.5. המשפט החשוב ביותר במדריך הוא ש-Sonnet מתאים במיוחד כשלמשימה יש הגדרה ברורה ודרך לבדוק את התוצאה.
תכנות מוגדר היטב
- תיקון באגים ומשימות קוד יומיומיות.
- המשימה ברורה והבדיקה פשוטה.
- המלצה: Sonnet.
פיתוח בנפח גבוה
- הרבה משימות קטנות ברצף.
- העלות ליחידה חשובה יותר מהברק.
- המלצה: Sonnet.
מסמכים מלוטשים
- מצגות, גיליונות ודפי סיכום.
- המבנה ידוע מראש.
- המלצה: Sonnet.
משימות סוכן חוזרות
- תהליך שרץ שוב ושוב באותה צורה.
- סקיל מגדיר מה נחשב טוב.
- המלצה: Sonnet.
עבודה שדורשת שיקול דעת
- משימות סוכן ארוכות ומורכבות.
- עבודת ידע בלי תשובה אחת נכונה.
- המלצה: Opus.
הבעיות הקשות ביותר
- כשצריך את מירב האינטליגנציה.
- כשטעות יקרה יותר מהטוקנים.
- המלצה: Opus.
כמה עולה כל מודל, ואיך נקבע המנצח?
התמחור פשוט לזכור. Sonnet 5.5 עולה 2 דולר למיליון טוקנים של קלט ו-10 דולר למיליון טוקנים של פלט. Opus 5.5 עולה 4 דולר לקלט ו-20 דולר לפלט, כלומר בדיוק פי שניים בשני הכיוונים. לעומת Sonnet 5 הקודם, הגרסה החדשה רצה מהר יותר בכשלושים אחוז ועולה עד שלושים אחוז פחות ברוב סוגי העבודה, כך שהפער בין המודל הבינוני למודל הבכיר נעשה משמעותי יותר מבחינה כלכלית.
כדי שההשוואה תהיה הוגנת, שני המודלים רצו על רמת מאמץ גבוהה, עם אותו פרומפט ובאותו זמן. אחרי כל מבחן נבדקו שלושה דברים: איכות התוצר, כמה זמן לקחה הריצה, וכמה היא עלתה. המבחנים נבדקו בלי לדעת מראש איזה תוצר שייך לאיזה מודל, והזיהוי נחשף רק אחרי שנקבעה ההעדפה. זה לא מבחן מעבדה, והטעם האישי משחק תפקיד, אבל זה קרוב למה שקורה כשמריצים את המודלים על עבודה אמיתית.
הכלל שקבע את המנצח בכל סבב
המנצח לא נקבע רק לפי התוצאה היפה יותר. אם שני התוצרים דומים באיכות, מנצח המודל שהיה זול ומהיר יותר. אם Opus נתן תוצאה טובה יותר, נשאלת שאלה נוספת: האם סבב תיקון אחד או שניים של Sonnet היו מביאים לאותה רמה בפחות כסף? אם כן, הניצחון הולך ל-Sonnet. Opus מנצח רק כשהפער באיכות גדול מספיק כדי להצדיק את המחיר גם אחרי שמביאים בחשבון סבבי תיקון.
זה כלל שכדאי לאמץ גם בעבודה היומיומית שלכם. המחיר האמיתי של משימה הוא לא העלות של הריצה הראשונה, אלא העלות הכוללת עד שמגיעים לתוצר שאפשר להשתמש בו. לפעמים ריצה יקרה אחת זולה יותר משלוש ריצות זולות, ולפעמים ההפך. ההבדל בין השניים תלוי כמעט תמיד באותו דבר: כמה ברורה ההגדרה של תוצר גמור שנתתם למודל מלכתחילה.
איפה Opus 5.5 הוביל, ולמה זה לא תמיד הספיק?
ארבעה מהמבחנים היו פתוחים יחסית: בקשה עם יעד כללי, בלי הגדרה מדויקת של איך התוצאה צריכה להיראות. במבחנים האלה ההבדל בין המודלים היה הכי בולט, והוא הראה משהו חשוב על האופן שבו כל אחד מהם חושב.
מבחן 1, דף נחיתה עם אנימציות גלילה
המשימה הייתה לבנות דף נחיתה סוחף שממיר, למותג של משקה אנרגיה, עם אפשרות לייצר תמונות לפי הצורך. Sonnet בנה אזור פתיחה מרשים, עם פחית שמגיבה לתנועת העכבר, אבל המציא הדמיה תלת-ממדית במקום להשתמש בתמונת המוצר האמיתית. Opus השתמש בתמונות המותג האמיתיות ובנה סיפור גלילה טוב יותר ברוב הדף. Sonnet רץ 28 דקות, Opus רץ 52 דקות ועלה כפול, בערך 13 דולר.
התוצר של Opus היה טוב יותר, אבל לא פי שניים. סבב תיקון אחד של Sonnet, עם בקשה פשוטה להחליף את ההדמיה בתמונות האמיתיות, היה כנראה מביא לתוצאה דומה בחצי מהמחיר. לכן לפי הכלל, הסבב הזה הלך ל-Sonnet.
מבחן 2, סרטון תדמית מונפש
הבקשה הייתה חופשית לגמרי: לחקור את המוצר, לשמור על המיתוג והטיפוגרפיה, ולבנות סרטון תדמית שמרשים. Sonnet הפתיע לטובה, עם הדגמה של המוצר בשימוש, קריינות שנוצרה בכלי קול, ופיקסלים שמתחברים לאות ועוברים לסרטון שנוצר בבינה מלאכותית. לעומתו, Opus נתן תוצאה שהרגישה נאמנה יותר למותג, עם אנימציות, עיצוב סאונד וקופי טובים יותר, ואף שילב ציטוט אמיתי מהאתר. Sonnet עלה 14.37 דולר, Opus עלה 20.55 דולר ורץ מהר יותר.
כאן Opus ניצח בבירור. גם אם Sonnet היה מקבל עוד סבבים עד שהעלות שלו הייתה משתווה, הטעם בתנועה ובסאונד היה עדיין חסר. עיצוב סאונד הוא תחום שקשה לדייק בו גם לבני אדם, והעקביות של Opus בו בולטת.
מבחן 3, תוכנית פעולה ל-90 יום
הפרומפט היה מעורפל בכוונה: תוכנית פעולה מבוססת מחקר להגיע לאלף מנויים לניוזלטר חדש תוך 90 יום. שני המודלים החזירו קודם קובץ טקסט, ואחרי בקשה זהה הפכו אותו לדף שנוח לקרוא. Sonnet בנה ציר זמן עמוס ולא אינטראקטיבי, עם תאריך השקה שלא התאים לעסק. Opus בנה תוכנית רבעונית ברורה יותר, מחולקת לחודשים, עם רשימת החלטות פתוחות ומסמך משימות מפורט. Sonnet רץ 14 דקות ועלה פחות מ-5 דולר, Opus רץ 20 דקות ועלה יותר מ-9 דולר.
Opus ניצח, ודווקא בגלל שהפרומפט היה מעורפל. בלי הגדרה של גמור, המודל צריך לחשוב כמו שותף ולהחליט בעצמו מה נחשב טוב, ושם הפער בין המודלים הכי גדול.
מבחן 6, לוח בקרה לחדשות מהרשת
המשימה הייתה לאסוף את חדשות היום מרשת חברתית ולבנות לוח בקרה אינטראקטיבי להכנת תוכן. Sonnet בנה לוח שימושי, שעקב אחרי 386 פוסטים מתוך 676 שנאספו, עם ציון חום לכל נושא, סינון, יומן אירועים ואפשרות להוסיף פריטים לתוכנית תוכן. Opus בנה תצוגה עשירה יותר, עם קצב פוסטים לשעה, נושאים שעולים ונושאים שדועכים, ותיוג לפי שמועה, שינוי או דיון. Opus רץ כשבע דקות יותר ועלה 6 דולר יותר.
בפרומפט אחד, התוצר של Opus היה טוב יותר. אבל אין בו שום דבר ש-Sonnet לא יכול לבנות אם מסבירים לו מה רוצים, ולכן לפי הכלל הסבב הלך ל-Sonnet.
הדפוס שחוזר בארבעת המבחנים ברור: Opus חושב יותר מחוץ לקופסה. הוא מוסיף תצוגות שלא ביקשו ממנו, מחפש חומר אמיתי במקום להמציא, ומנסה לתת חוויה טובה יותר מהבקשה המילולית. Sonnet נותן את מה שהוא חושב שרציתם, ברמה סבירה, ועוצר שם. כשאתם לא יודעים בדיוק מה אתם רוצים, ההבדל הזה שווה כסף. כשאתם יודעים, הוא הרבה פחות חשוב.
מה קרה כשהמשימה הוגדרה היטב?
שלושת המבחנים האחרים היו מובנים יותר: היה ברור מה התוצר הסופי, ולפעמים סקיל קיים הגדיר מראש איך הוא צריך להיראות. במבחנים האלה התמונה התהפכה, ו-Sonnet הצליח לסגור את הפער כמעט לגמרי.
במבחן הרביעי שני המודלים קיבלו נתונים מדומים של חברה, והתבקשו לבנות גיליון אקסל ומצגת למשקיעים. Opus בנה מצגת של 18 שקפים עם תמונות שנוצרו במיוחד, וגיליון עם לשוניות של לוח בקרה, הנחות, מדדים חודשיים ודוח רווח והפסד רבעוני. הדבר החשוב ביותר בגיליון היה שכמעט כל תא מחושב בנוסחה, כך ששינוי בנתונים מעדכן את כל הקובץ. גם הגיליון של Sonnet היה מלא בנוסחאות, עם עוד יותר לשוניות, והמצגות של שני המודלים היו כמעט זהות. כשהתוצרים דומים, מנצח הזול והמהיר, ובמקרה הזה דווקא Opus היה זול ומהיר יותר. תזכורת טובה לכך שהמחיר למיליון טוקנים הוא לא המחיר של המשימה.
במבחן החמישי שני המודלים השתמשו בסקיל פשוט שבונה דפי הסבר, כדי לענות על השאלה אילו מודלים מקומיים אפשר להריץ על מחשב ביתי עם כרטיס גרפי של 32 ג'יגה. Opus הסביר טוב יותר את הכלל המרכזי: המודל צריך להיכנס לזיכרון של הכרטיס הגרפי, ולכן מודל של 20 ג'יגה ירוץ ומודל של 43 ג'יגה לא. Sonnet היה ויזואלי יותר, והתחיל מהסבר של מה זה בכלל מודל מקומי, אבל פחות הסביר את הסיבה. הזמנים היו דומים ו-Sonnet עלה חצי, בערך 3 דולר פחות. סבב הבהרה אחד היה מביא אותו לתוצאה טובה יותר, ולכן הסבב הלך אליו.
במבחן השביעי שני המודלים קיבלו קישור לסרטון והתבקשו להפוך אותו למדריך משאבים, בעזרת סקיל שנמצא בשימוש קבוע. התוצרים יצאו כמעט זהים: אותו אורך, אותה כותרת, אותו מבנה של רקע, כללים, שלבים, תוצאות ולקחים. Sonnet רץ פי שניים מהר יותר ועלה 1.40 דולר פחות. כאן בדיוק רואים את תפקיד הסקיל: הוא מגדיר מה נחשב טוב, ומודל פחות חזק מצליח לעקוב אחרי ההוראות כי הוא יודע בדיוק מה רוצים ממנו. זה גם הרעיון שעומד מאחורי סקיל לעבודה עם גיליונות אקסל, שמכתיב מראש שימוש בנוסחאות במקום ערכים קבועים.
גיליון בלי נוסחאות הוא גיליון מת
אחת ההערות החשובות בהדגמה לא קשורה לבחירת מודל בכלל: גיליון אקסל שמודל מחזיר עם ערכים קבועים במקום נוסחאות כמעט חסר תועלת. כל שינוי בנתון אחד מחייב לחזור לסוכן ולבקש ממנו לחשב הכול מחדש. כשמבקשים גיליון, כדאי לדרוש במפורש שכל תא מחושב יהיה נוסחה, ולבדוק כמה תאים באקראי לפני שמשתמשים בקובץ. שני המודלים עמדו בזה במבחן, אבל זה לא מובן מאליו.
מה אומרים המספרים בסוף שבעת המבחנים?
בספירה הסופית, ארבעה מבחנים הלכו ל-Sonnet ושלושה ל-Opus. אבל התוצאה הזאת מטעה אם קוראים אותה כמו טבלת ליגה. בכמה מהמבחנים ש-Sonnet ניצח, התוצר של Opus היה טוב יותר בפרומפט אחד, והניצחון ניתן ל-Sonnet רק משום שסבב תיקון נוסף היה כנראה מביא אותו לאותה רמה בפחות כסף. זו לא השוואה של מי חכם יותר, אלא של מתי ואיך להשתמש בכל מודל.
הנתון המעניין ביותר הוא שבסך הכול Opus לא עלה פי שניים. הוא צרך כ-38 מיליון טוקני קלט יותר, אבל דווקא פחות טוקני פלט, והעלות הכוללת שלו הייתה גבוהה בכ-16 דולר בלבד על פני שבע ריצות. המשמעות היא שמחיר כפול למיליון טוקנים לא מתורגם אוטומטית לחשבון כפול. מודל חזק יותר לפעמים מגיע לתוצאה בפחות צעדים, כותב פחות, ומבזבז פחות על ניסיונות שלא מובילים לשום מקום.
במבחן דף הנחיתה, לעומת זאת, רואים את המקרה ההפוך: Sonnet צרך כ-20 מיליון טוקני קלט ו-134 אלף טוקני פלט, ו-Opus צרך כ-37 מיליון טוקני קלט ו-148 אלף טוקני פלט, רץ כמעט פי שניים זמן ועלה כמעט פי שניים. ההבדל בין המקרים הוא אופי המשימה. כשהמשימה פתוחה, Opus חוקר יותר וקורא יותר, וזה עולה. מי שרוצה להבין איך רמת המאמץ עצמה משפיעה על המספרים האלה ימצא השוואה של שש רמות המאמץ ב-Opus 5.5 על אותה משימה.
איך בונים מפת ניתוב של מודלים לפי סקיל?
המסקנה המעשית החשובה ביותר מההדגמה היא לא בחירה חד-פעמית של מודל, אלא שיטת עבודה. במקום להחליט פעם אחת שעובדים עם Opus או עם Sonnet, מריצים כל סקיל או תהליך חוזר על שני המודלים, בודקים באיזה מהם התוצאה עומדת בדרישות, ורושמים את זה. בפעם הבאה שהסקיל רץ, כבר יודעים איזה מודל לבחור, ולא משלמים על אינטליגנציה שהמשימה לא צריכה.
הדרך הפשוטה לנהל את זה היא קובץ אחד בתיקיית הפרויקט, שמתעד את ההחלטה לכל סקיל יחד עם הסיבה. הסיבה חשובה לא פחות מההחלטה, כי כשמודל חדש יוצא או כשהסקיל משתנה, צריך לדעת מה לבדוק מחדש. כך נראית מפה כזאת בפועל:
# model-routing.md
# Decided by running each skill on both models with the same input.
| Skill / task | Model | Why |
|------------------------------|--------|--------------------------------------------|
| resource-guide (from video) | sonnet | Skill defines the layout. Same output, half the cost. |
| html-explainer | sonnet | Visual is fine. One follow-up prompt fixes gaps. |
| spreadsheet + investor deck | either | Near identical output. Pick the cheaper run. |
| bug fix with failing test | sonnet | Clear definition of done: the test passes. |
| motion / brand video | opus | Taste in motion and sound. Sonnet never caught up. |
| open-ended strategy / plan | opus | Vague goal, needs a thinking partner. |
Re-test a row when: a new model ships, the skill changes, or output quality drops.המבנה הזה עובד טוב במיוחד בעבודה עם סוכנים, שבה אותו תהליך רץ עשרות פעמים. חיסכון של חצי מהעלות בסקיל שרץ פעם בחודש לא משנה הרבה. חיסכון של חצי בסקיל שרץ כל יום, או בסוכן שמטפל בכל פנייה שנכנסת, הוא הבדל אמיתי בחשבון. מי שבונה סוכנים כאלה יכול לקרוא עוד על היכולות והמגבלות של המודלים עצמם בסקירה המלאה של Claude, כולל ההבדלים בין המודלים השונים במשפחה.
איך כותבים פרומפט שהמודל הזול מצליח בו?
אם הכלל המרכזי הוא ש-Sonnet מצליח כשיש הגדרה ברורה של גמור, הדרך להוזיל עבודה היא לכתוב פרומפטים שמכילים הגדרה כזאת. בהדגמה עולה הערכה מעניינת: בתוכנית ל-90 יום, אם הפרומפט היה מפרט מה רוצים, איך זה צריך להיראות ומה חייב להופיע, סביר ששני המודלים היו מגיעים לתוצאה דומה, ו-Sonnet היה זול יותר. הפער נוצר בגלל שהפרומפט השאיר את כל ההחלטות למודל.
הנה אותה בקשה, כתובה כך שיש לה הגדרה של תוצר גמור. שימו לב שהיא לא ארוכה בהרבה, אבל היא מעבירה למודל את ההחלטות שבגרסה המעורפלת הוא היה צריך לקבל לבד:
Build a 90-day growth plan for our new newsletter. Goal: 1,000 subscribers.
Definition of done:
- Starts on the first day of next month, split into 3 monthly phases
- Each phase: goal number, 5-8 tasks with an owner, and one metric to track
- A table of subscriber sources with an expected number for each
- A short list of open decisions we must make before launch
- Output: one HTML page, readable on mobile, no external libraries
Use only the data in ./audience.md and ./channels.md. Mark any assumption clearly.הפרומפט הזה עושה שלושה דברים. הוא קובע מבנה, כך שהמודל לא צריך לנחש איך להציג את התוכנית. הוא קובע רשימת בדיקה, כך שאפשר לבדוק את התוצר נקודה אחר נקודה ולדעת אם הוא גמור. והוא מגביל את מקורות המידע, כך שהמודל לא ממציא נתונים. אחרי שמשימה נכתבה כך פעם אחת, כדאי להפוך אותה לסקיל, ואז גם הריצות הבאות יקבלו את אותה הגדרה בלי שתצטרכו לכתוב אותה מחדש.
ומתי לא כדאי להשקיע בפרומפט מפורט? כשאתם עצמכם עוד לא יודעים מה התוצר הנכון. במצב כזה עדיף לתת ל-Opus לחשוב ולהציע כיוון, ורק אחרי שהכיוון ברור לכתוב את ההגדרה המפורטת ולהעביר את ההרצות החוזרות ל-Sonnet. זו חלוקת עבודה טבעית: המודל החזק עוזר להגדיר את היעד, והמודל הזול מבצע אותו שוב ושוב.
מתי לבחור ב-Sonnet, ומתי לשלם על Opus?
הכלל שעולה משבעת המבחנים פשוט: אם למשימה יש הגדרה אובייקטיבית של גמור, מתחילים עם Sonnet 5.5. אם צריך יצירתיות, שיקול דעת או שותף לחשיבה שיעזור להחליט מה בכלל נחשב טוב, Opus 5.5 מחזיר את המחיר. הרשימות הבאות עוזרות לשייך משימה לצד הנכון לפני שמריצים אותה.
מתחילים עם Sonnet
- יש סקיל שמגדיר איך התוצר נראה.
- אפשר לבדוק את התוצאה מול רשימה או בדיקה.
- המשימה חוזרת הרבה פעמים.
- תיקון באגים עם בדיקה שנכשלת.
- מסמכים, גיליונות ומצגות במבנה ידוע.
משלמים על Opus
- עדיין לא ברור מה התוצר הנכון.
- צריך טעם: תנועה, סאונד, סיפור.
- תכנון אסטרטגי מיעד כללי.
- משימת סוכן ארוכה עם הרבה החלטות.
- טעות תעלה יותר מהטוקנים.
חמש תובנות מההשוואה
הגדרת גמור קובעת את המודל
כשיש דרך אובייקטיבית לבדוק שהמשימה הושלמה, המודל הזול מגיע לרוב לאותה תוצאה. כשאין, המודל החזק שווה את הכסף כי הוא זה שמחליט מה נחשב טוב.
מחיר כפול אינו חשבון כפול
על פני שבע ריצות Opus עלה רק כ-16 דולר יותר. במשימת המסמכים הוא היה אפילו זול ומהיר יותר, כי הגיע לתוצאה בפחות צעדים ובפחות טוקני פלט.
ספרו את העלות עד תוצר שמיש
ריצה ראשונה היא לא המחיר של המשימה. אם סבב תיקון אחד של Sonnet מביא לאותה רמה, הוא עדיין זול יותר. אם לא, הריצה היקרה היא החסכונית.
סקיל טוב מצמצם את הפער
במבחנים שבהם סקיל הגדיר את מבנה התוצר, התוצאות של שני המודלים היו כמעט זהות. סקיל הוא בעצם הגדרה של גמור שנכתבה פעם אחת ועובדת בכל ריצה.
בודקים על המשימות שלכם
שום השוואה חיצונית לא מחליפה בדיקה על הסקילים והתהליכים שלכם. מריצים כל תהליך חוזר על שני המודלים פעם אחת, רושמים את ההחלטה, וחוזרים לבדוק כשיוצא מודל חדש.
סיכום: איך לבחור מודל בלי לשלם על אינטליגנציה מיותרת?
ההשוואה בין Sonnet 5.5 ל-Opus 5.5 לא מסתיימת בהכרזה על מנצח, אלא בשיטת עבודה. Opus הוא המודל החזק יותר, ובמשימות פתוחות, יצירתיות או מעורפלות הוא מחזיר את המחיר שלו. Sonnet עולה חצי, רץ מהר יותר, וכשיש לו הגדרה ברורה של תוצר גמור, או סקיל שמכתיב את המבנה, הוא מגיע לאותה תוצאה או קרוב אליה מאוד. הצעד הראשון הוא לעבור על התהליכים החוזרים שלכם ולשאול על כל אחד אם יש לו הגדרה אובייקטיבית של גמור.
העיקרון הזה רלוונטי במיוחד כשבונים מערכות שרצות כל יום ומשתמשות במודל שוב ושוב. למשל פיתוח לוח בקרה למנהלים שמסכם נתונים עסקיים מדי בוקר: המבנה ידוע, הבדיקות ברורות, ולכן ברוב המקרים המודל הבינוני יספיק, והמודל הבכיר יישמר לניתוחים הפתוחים שבהם באמת צריך שיקול דעת.
מי שרוצה לבנות מערכות כאלה בעסק, עם בחירה נכונה של מודל לכל חלק ובלי לשלם על כוח שלא נחוץ, מוזמן לקבוע איתי שיחה ולבדוק ביחד מאיפה כדאי להתחיל.
שיתוף הפוסט
שאלות ותשובות
מה ההבדל במחיר בין Sonnet 5.5 ל-Opus 5.5?
Sonnet 5.5 עולה 2 דולר למיליון טוקנים של קלט ו-10 דולר למיליון טוקנים של פלט. Opus 5.5 עולה 4 ו-20 דולר בהתאמה, כלומר פי שניים בדיוק. בפועל, העלות של משימה תלויה גם בכמות הטוקנים שכל מודל צורך. בהשוואה שבניתוח, על פני שבע משימות Opus עלה רק כ-16 דולר יותר, ובמשימה אחת הוא אפילו היה הזול מבין השניים, כי הגיע לתוצאה בפחות צעדים.
האם Sonnet 5.5 טוב יותר מ-Sonnet 5?
לפי נתוני ההשקה, Sonnet 5.5 רץ מהר יותר בכשלושים אחוז מהדור הקודם, ועולה עד שלושים אחוז פחות ברוב סוגי העבודה. בהדגמה הוא הפתיע במיוחד במשימות יצירתיות כמו סרטון מונפש, שבהן לא ציפו ממודל בינוני לתוצאה טובה. זה עדיין מודל בינוני, אבל הפער בינו לבין המודל הבכיר קטן במשימות מוגדרות היטב, ונשאר בעיקר במשימות פתוחות שדורשות שיקול דעת.
מתי Opus 5.5 שווה את המחיר הכפול?
כשהמטרה פתוחה ואין הגדרה ברורה של תוצר גמור. בהדגמה Opus ניצח בבירור בסרטון תדמית מונפש, שבו הטעם בתנועה ובסאונד היה קריטי, ובתוכנית פעולה שנכתבה מפרומפט מעורפל, שבה המודל היה צריך לחשוב כמו שותף. גם במשימות סוכן ארוכות עם הרבה החלטות, ובמשימות שבהן טעות תעלה יותר מהטוקנים, המודל החזק הוא בחירה נכונה.
מה זו הגדרה של תוצר גמור?
זו רשימה שמאפשרת לבדוק באופן אובייקטיבי שהמשימה הושלמה. למשל, בדיקה אוטומטית שעוברת, מבנה מסמך עם סעיפים קבועים, או דרישה שכל תא מחושב בגיליון יהיה נוסחה. כשיש הגדרה כזאת, גם מודל פחות חזק יודע בדיוק לאן לכוון ומתי לעצור. כשאין, המודל צריך להחליט בעצמו מה נחשב טוב, ושם מודל חזק יותר מביא ערך שמצדיק את המחיר.
למה המנצח לא נקבע רק לפי התוצאה הטובה יותר?
כי המחיר האמיתי של משימה הוא העלות עד שמגיעים לתוצר שאפשר להשתמש בו. אם Opus נתן תוצאה מעט טובה יותר, אבל סבב תיקון אחד של Sonnet היה מביא לאותה רמה בחצי מהמחיר, הבחירה החסכונית היא Sonnet. רק כשהפער באיכות גדול מספיק כדי שגם כמה סבבי תיקון לא יסגרו אותו, המודל היקר מנצח גם מבחינה כלכלית.
האם כדאי להשוות לפי תמחור API או לפי מכסת מנוי?
לצורך השוואה, תמחור ה-API הוא מדד אחיד יותר. אחוזים ממכסת מנוי תלויים בחבילה שלכם, ולכן אותה ריצה נראית שונה אצל כל אחד. דולרים לפי מיליון טוקנים אפשר לתרגם לכל חבילה, והיחס בין המודלים נשמר גם כשעובדים דרך מנוי. בפועל, מודל שעולה פי שניים ב-API ישחק בערך פי שניים מהר יותר את המכסה החודשית שלכם.
איך סקיל משפיע על הבחירה בין המודלים?
סקיל טוב הוא בעצם הגדרה של תוצר גמור שנכתבה פעם אחת. הוא מכתיב מבנה, סגנון ובדיקות, ולכן המודל לא צריך לנחש מה רוצים ממנו. בהדגמה, במבחן שבו סקיל קבוע הגדיר מדריך משאבים, התוצרים של שני המודלים היו כמעט זהים, ו-Sonnet רץ פי שניים מהר יותר ועלה פחות. ככל שהסקיל מדויק יותר, כך המודל הזול מספיק יותר, והחיסכון מצטבר בכל ריצה.
איך מתחילים לבנות מפת ניתוב מודלים?
בוחרים את חמשת התהליכים או הסקילים שאתם מריצים הכי הרבה, ומריצים כל אחד פעם אחת על שני המודלים עם אותו קלט. משווים איכות, זמן ועלות, ורושמים בקובץ אחד איזה מודל נבחר ולמה. מתחילים עם Sonnet בכל מה שיש לו הגדרה ברורה של גמור, ובודקים מחדש את הטבלה כשיוצא מודל חדש או כשהסקיל משתנה באופן משמעותי.