הדמו לא עולה כלום. זו הבעיה.

כל טוטוריאל LLM עובד עם קומץ קריאות בדיקה שעולות שברי סנט. אתם משיקים, המשתמשים מגיעים, והחשבון שמגיע אחריהם הוא הפעם הראשונה שרוב המייסדים בודקים ברצינות את מחירי ה-LLM בפרודקשן. בשלב הזה כבר קיבלתם את ההחלטות הארכיטקטוניות היקרות.

זהו פוסט 5 בסדרת ה-AI pillar. הפוסטים הקודמים כיסו בחירת ה-LLM הנכון לסטארטאפ, מתי RAG שווה לבנות, סוכני AI לכלים פנימיים ואוטומציה עם AI לעסק. הפוסט הזה עוסק במה שהארכיטקטורה הזו באמת עולה כשמשתמשים אמיתיים מגיעים.

טבלת עלות-ל-1M-טוקן (המספר שכל צוות חייב להפנים)

מחירים משתנים תכופות — בדקו את התיעוד הרשמי לפני שמתחייבים. מחירים משוערים לאמצע 2026:

מודל קלט / 1M טוקן פלט / 1M טוקן הערות
Gemini 1.5 Flash ~$0.075 ~$0.30 האפשרות הזולה ביותר לנפח גבוה
GPT-4o mini ~$0.15 ~$0.60 מודל סיווג זול ונפוץ
Claude Haiku ~$0.25 ~$1.25 מהיר + עדין; מתאים לצעדי agent
Gemini 1.5 Pro ~$1.25 ~$5.00 מסמכים ארוכים, GCP-native; חלון הקשר רחב
Claude Sonnet ~$3.00 ~$15.00 agents מורכבים, קוד, עיבוד מסמכים
GPT-4o ~$5.00 ~$15.00 אקוסיסטם עמוק; הכי versatile
Claude Opus ~$15.00 ~$75.00 איכות reasoning מקסימלית; השתמשו בצמצום

הטבלה חושפת פער של 200× בעלות בין האפשרות הזולה לאפשרות היקרה. צוותים שמנתבים לפי מורכבות הבקשה משתמשים במודלים מתקדמים ל-10–20% מהבקשות שמצדיקות זאת, ובמודלים זולים לכל השאר. צוותים שמשתמשים במודל flagship אחד לכל דבר משלמים מחיר frontier על עבודה שלא צריכה אותו.

דוגמה מחושבת: 10,000 משתמשים ביום

נניח שיש לכם פיצ'ר AI שמייצר סיכום ממסמך שהמשתמש מגיש. כל בקשה: ~2,000 טוקני קלט (המסמך) ו-~500 טוקני פלט (הסיכום). ב-10,000 בקשות ביום:

עם GPT-4o:

עם Claude Haiku:

זה הבדל של 15× על אותה משימה. אם GPT-4o ו-Claude Haiku מספקים איכות שקולה בסיכום מסמכים — בדקו על 50 דוגמאות אמיתיות, לעתים קרובות הם כן — זה $4,900/חודש של עלות שניתן להימנע ממנה ב-10K משתמשים ביום, צומחת לינארית עם הצמיחה שלכם.

זו גם הסיבה שבחירת מודל היא החלטה ארכיטקטונית, לא סתם בחירת כלים. שינוי אחרי ההשקה אומר ביקורת על כל prompt, הרצה מחדש של האבלואציות ואולי בנייה מחדש של טיפול בשגיאות. לא עבודת אחר-צהריים.

Prompt caching: החיסכון שרוב הצוותים מפספסים

גם Anthropic (Claude) וגם Google (Gemini) מציעות prompt caching — יכולת לשמר את הטוקנים הראשוניים של הפרומפט ולעשות בהם שימוש חוזר ברמת עלות נמוכה משמעותית.

מתי זה רלוונטי? בכל פעם שיש לכם system prompt גדול, מסמך ייחוסי, או קטע בסיס ידע שמופיע בכל קריאה. בזרימות עבודה של agent, זה כמעט תמיד נכון — ההוראות וההקשר של ה-agent הם בדרך כלל החלק הגדול ביותר של הקלט.

מודל ה-caching של Claude (משוער):

ההשפעה בקנה מידה: agent של Claude Sonnet עם system prompt של 5,000 טוקן שרץ ב-10K בקשות ביום:

שיעורי cache hit מעל 80% יכולים להוריד עלויות inference של Claude ב-40–60% בזרימות עבודה עם הרבה פרומפטים. זה הופך את Claude לתחרותי יותר ממה שהמחיר לטוקן מרמז עליו — במיוחד ב-agent ועיבוד מסמכים שבהם אותו הקשר חוזר בכל קריאה.

Batching לעומסי עבודה אסינכרוניים

לא כל קריאת LLM צריכה לקרות בזמן אמת. עיבוד מסמכים, יצירת דוחות, ניתוח לילי ועבודות העשרה ברקע יכולים לרוץ כ-batch workloads — וה-Batch APIs זולים משמעותית יותר.

OpenAI Batch API: ~50% הנחה על מחיר רגיל; אסינכרוני, תוצאות מוחזרות תוך 24 שעות.

Anthropic Message Batches: הנחת מחיר ומודל אסינכרוני דומים.

לכל עומס עבודה שלא דורש תגובה בזמן אמת למשתמש, batching הוא חיסכון ללא עלות נוספת. pipeline ליצירת דוחות שעלה $300/חודש ב-GPT-4o בזמן אמת עשוי לעלות $150/חודש על ה-Batch API ללא שינוי באיכות.

עלות הפיתוח: צריך לטפל ב-async callbacks במקום בתגובות סינכרוניות. ברוב כלי ה-workflow (n8n, Make, worker queue פשוט), זו שינוי חד-פעמי.

שלוש טעויות עלויות שצוותים עושים אחרי השקה

1. מודל אחד לכל דבר. שימוש ב-GPT-4o לסיווג כרטיסי תמיכה זה כמו לשכור אדריכל בכיר לענות על כל מייל תמיכה. תקרת איכות הפלט לאותה משימה נמוכה מתקרת יכולת המודל — אתם משלמים מחירי frontier על עבודת commodity.

2. תשלום על טוקנים שאתם לא משתמשים בהם. קריאות LLM רבות מפיקות הרבה יותר טוקנים מהנדרש כי ה-prompt לא מגביל את אורך הפלט. "סכם את זה ב-2–3 משפטים" הוא גם UX טוב יותר וגם זול באופן דרמטי מ-prompt פתוח שמחזיר 1,000 טוקן.

3. אין observability על עלויות. אם אתם לא עוקבים אחרי שימוש בטוקנים לכל קריאה ומיפוי לפיצ'רים ומשתמשים, אין לכם אות על מקום האופטימיזציות בעלות הגבוהה ביותר. שימוש בטוקנים צריך להיות מטריקה ראשית ב-observability stack שלכם — לא מחשבה אחורית שמסתכלים עליה רק כשהחשבון מפתיע אתכם.

מתי self-hosting LLM כדאי כלכלית

השאלה שחוזרת בכל אבן דרך: האם כדאי לנו לאחסן בעצמנו?

התשובה הישרה: כמעט אף פעם לפני $50K/חודש בהוצאות API. אחסון עצמאי של מודל open-weight באיכות frontier (Llama 3.1, Mistral Large, Qwen 2.5) דורש:

ב-$10K/חודש בעלויות API, ה-API בענן הוא כמעט בוודאות זול יותר כשמחשבים שעות הנדסה להקמה ותחזוקה שוטפת. ב-$100K/חודש, החישוב לעיתים קרובות מתהפך — אבל אמתו עם דפוס השימוש ודרישות המודל הספציפיים שלכם.

האמצע: ספקי inference מנוהלים (Together.ai, Fireworks.ai, Replicate) מריצים מודלים open-weight במחירים תחרותיים עם ספקי ה-API הגדולים, ללא נטל ה-ops. שווה לבדוק לפני שמריצים בעצמכם.

שלוש שאלות לפני ההשקה

לפני שפיצ'ר ה-AI שלכם עולה לאוויר, שלוש שאלות שמונעות הפתעות יקרות:

  1. מה נפח הבקשות הריאלי בהשקה לעומת תחזיות ל-6 חודשים? הריצו את חישוב הטוקנים על שניהם. וודאו שהתחזית ל-6 חודשים לא דורשת שיחת מחיר שלא קיימתם.

  2. האם המקרה שלכם באמת צריך מודל frontier? בדקו את הגרסה הזולה על 50 דוגמאות אמיתיות מהמשתמשים שלכם. פער האיכות קטן יותר ממה שאתם מצפים במשימות מובנות.

  3. האם יש הקשר גדול חוזר בכל קריאה? אם כן, prompt caching צריך להיות בתוכנית ההטמעה שלכם מהיום הראשון — תוספת ארכיטקטונית שקל יותר להוסיף מוקדם מאשר לשלב לאחר מכן.

הפער בין "עלות הדמו" ל"עלות הפרודקשן" הוא אמיתי, אבל לגמרי צפוי. המייסדים שמפספסים את ההפתעה עושים את החישוב לפני הבנייה, לא אחרי החשבון הראשון.

אם אתם בשלב הארכיטקטורה ורוצים חוות דעת שנייה על מבנה העלויות לפני שמתחייבים למחסנית, CTO חלקי יכול לעזור לכם לסגור את זה נכון. קבעו שיחה — ללא התחייבות, ללא מכירה.


זהו פוסט 5 בסדרת ה-AI pillar. התחילו באוטומציה עם AI לעסק, המשיכו דרך סוכני AI לכלים פנימיים, RAG, בחירת ה-LLM הנכון, ואז לפוסט הזה. הבא בסדרה: הנדסת פרומפטים בפרודקשן — 6 הדפוסים שמשפרים אמינות ועקביות פלט ה-LLM בקנה מידה. אחר כך: בדיקות ומעקב לאפליקציות AI בפרודקשן — 5 מדדים וכלים שהופכים את הפיצ'רים ה-AI שלכם לגלויים כשמשהו משתבש בשעה שתיים לפנות בוקר.

כתיבת תגובה

האימייל לא יוצג באתר. שדות החובה מסומנים *