המהלך מסמן את המעבר של מפתחת ChatGPT מחברת תוכנה ומחקר בלבד, לפלטפורמת מחשוב בעלת אינטגרציה מלאה (Vertical Integration) השולטת על כל שכבות המערכת – מהאלגוריתם והתוכנה ועד לחומרת הסיליקון.

מה מיוחד בשבב Jalapeño?

בשונה ממאיצים גרפיים כלליים (GPUs) שהותאמו עם השנים לחישובי בינה מלאכותית, Jalapeño תוכנן מאפס (Blank-slate design) במיוחד למשימות הסקה (Inference) עבור מודלי שפה גדולים (LLMs):

  • אופטימיזציה להרצת מודלים בזמן אמת: השבב מיועד להפעלת שירותים כמו ChatGPT, Codex, ממשקי ה-API וסוכני AI אוטונומיים, תוך שמירה על זמני תגובה (Latency) מינימליים ויכולת שירות לעשרות מיליוני משתמשים במקביל.

  • חיסכון של כ-50% בעלויות התפעול: לפי בדיקות מעבדה ראשוניות, השבב מציג יעילות אנרגטית גבוהה במיוחד (Performance per Watt) וצפוי לחתוך את עלויות החשמל והתפעול של הדאטה-סנטרים בעד 50% לעומת כרטיסי GPU קיימים.

  • ארכיטקטורה מותאמת תעבורת נתונים: השבב מצמצם תנועות נתונים מיותרות ומאזן בין עוצמת חישוב, רוחב פס לזיכרון וטכנולוגיות רשת מתקדמות של ברודקום (כגון מתגי Tomahawk) כדי להגיע לניצולת מקסימלית בפועל.

  • פיתוח שובר שיאים של 9 חודשים: תהליך ה-Tape-out הושלם תוך תשעה חודשים בלבד, כאשר מודלי ה-AI של OpenAI שימשו בעצמם להאצת תהליכי התכנון, הסימולציה והאופטימיזציה של הסיליקון.

תמונת מצב מול השוק: צמצום התלות ב-Nvidia

שוק חומרת ה-AI נשלט כיום כמעט בלעדית על ידי Nvidia. בעוד ששלב אימון המודלים (Training) עדיין נשען בכבדות על מעבדי Nvidia, שלב ההסקה וההרצה השוטפת (Inference) מהווה כיום את עיקר הוצאות המחשוב והאנרגיה של OpenAI.

פיתוח שבב עצמאי מאפשר ל-OpenAI:

  1. חופש משרשרת אספקה מוגבלת: הגדלת היקף הפריסה של מרכזי נתונים (בהספקי Gigawatt) יחד עם מיקרוסופט ושותפות נוספות החל מ-2026.

  2. הוזלת עלויות למשתמשי הקצה: הורדת עלויות ה-API ומענה מהיר יותר לפניות המשתמשים.

  3. גיוון ספקים: שילוב פתרונות מחומרה מגוונת (כולל AMD, Cerebras ו-Broadcom) במקביל להמשך רכישות מ-Nvidia.

לסיכום

ההשקה של Jalapeño מוכיחה כי העתיד של מודלי השפה הגדולים אינו תלוי רק בפרמטרים ובאלגוריתמים, אלא גם בהתאמה מדויקת עד לרמת הטרנזיסטור. ככל שהשימוש בסוכני AI ובשירותים מבוססי שפה מתרחב, השליטה בחומרה הופכת ליתרון תחרותי קריטי.