מעבדת מחקר · מודלים שרצים אצלכם

Frontier models. החומרה שלכם.

עוזרים לכם להפעיל מודלים פתוחים אצלכם, בעלות נמוכה יותר ובפחות מאמץ. בוחרים מודל, מתאימים אותו למשימות שלכם ומקימים את המערכת על חומרה שמתאימה לתקציב.

לצוותים שמשלמים על API של מודלים, בונים מערכות agents או צריכים שהמידע יישאר אצלם. גם אם כבר יש לכם מודל שרץ על שרתים משלכם או בחשבון הענן שלכם.

מה הם frontier models? כינוי למודלים שנחשבים למובילים ביכולותיהם. ההתאמה למשימה שלכם עדיין דורשת בדיקה. מדריך למושגים באתר.

במה אפשר לעזור?

מתחילים מהבעיה שאתם צריכים לפתור.

לכל השירותים

מחקר שאפשר לבחון

אנחנו חוקרים דרכים להקטין את צריכת הזיכרון של מודלים, להאיץ את יצירת התשובות ולשפר את העבודה בעברית. בכל מחקר מפורטים תנאי הניסוי והמגבלות שלו. כדי לדעת מה יעבוד אצלכם, צריך לבדוק גם על המשימות שלכם.

קראו את המחקר

כל העמודות מתחילות מאפס. יחידות המדידה: %

בדיקה על קטעי קוד

בדיקה על קטעי קוד: BF16 62.61 %; NVFP4 61.32 %BF1662.61 %NVFP461.32 %
התאמה בין הצעת הטוקן הראשון למודל הראשי, בבדיקה על קוד. (%)תאריך המדידה חומרה: RTX PRO 6000 Blackwellבדיקה על קטעי קוד קבועים במודל Qwen3.5-9B: באיזה אחוז מהמקרים הצעת הטוקן הראשון תואמת לבחירת המודל הראשי. טוקן הוא יחידת טקסט, למשל חלק ממילה. BF16 הוא פורמט המשקלים המקורי שנבדק; בגרסת NVFP4 חלק מהמשקלים נשמרים בפחות ביטים. המדד אינו מודד איכות תשובות או מהירות יצירת טקסט.תיעוד המדידה hqmtp (באנגלית)הסבר למונחים ולמדדים בתרשים
עיינו בטבלת הנתונים
התאמה בין הצעת הטוקן הראשון למודל הראשי, בבדיקה על קוד. · %
תנאי הבדיקהBF16NVFP4
בדיקה על קטעי קוד62.61 %61.32 %

Quantization מצמצמת את הזיכרון שנדרש לאחסון המספרים של המודל, ויכולה לאפשר הרצה על כרטיס עם פחות זיכרון. בגרף בדקנו מנגנון האצה שמציע טוקן, כלומר יחידת טקסט, לפני שהמודל הראשי מאמת אותו. שיעור ההתאמה של הטוקן הראשון היה דומה עם ובלי quantization בניסוי הזה. זו אינה בדיקת איכות של התשובות. להסבר על טוקנים ומנגנון ההאצה.

מה מתאים לחומרה שלכם?

מודל שנכנס לזיכרון הוא רק ההתחלה. הבחירה תלויה גם באיכות התשובות, באורך הקלט, במספר הבקשות במקביל ובעלות התפעול של המערכת.

המשימה והדוגמאותבדיקות איכותעומס צפויחומרה ותקציבשיקולי הבחירהבחירת מודלזיכרון והרצהזמן תגובהעלות תפעול כוללתמה מקבליםהמלצה מבוססת מדידותוהגדרת היקף הפריסה
  1. נתוני הבסיס

    • המשימה והדוגמאות
    • בדיקות איכות
    • עומס צפוי
    • חומרה ותקציב
  2. שיקולי הבחירה

    • בחירת מודל
    • זיכרון והרצה
    • זמן תגובה
    • עלות תפעול כוללת
  3. מה מקבלים

    • המלצה מבוססת מדידות והגדרת היקף הפריסה.

דברו איתנו על בחירת מודל וחומרה

האם המעבר משתלם?

אנחנו משווים את חשבון ה־API שלכם לעלות הכוללת של הפעלת מודל פתוח שמתאים לצרכים שלכם, על החומרה שלכם או בחשבון הענן שלכם. ההצעה כוללת התאמת מודל, הקמה, תשתיות, תפעול ותמיכה, ומפרידה בין עלויות ההקמה לעלויות השוטפות. כך תראו אם המעבר משתלם. המערכת, המידע ויומני הפעילות בשליטתכם.

מהדוגמאות שלכם למערכת שתוכלו להפעיל

לכל שלב מטרה ברורה, מההשוואה הראשונה ועד למסירה ולתמיכה המתמשכת.

  1. בוחרים

    מגדירים את המשימה ומשווים מודלים ואפשרויות חומרה.

  2. מתאימים

    בודקים fine-tuning ושינויים במערכת ההרצה כשיש בעיה שהמדידות מצדיקות לפתור.

  3. פורסים

    מתקינים, בודקים ומתעדים את המערכת על החומרה שלכם או בחשבון הענן שלכם.

  4. ממשיכים לתמוך

    היקף התמיכה ומסירת המערכת נקבעים בהצעת העבודה.

צוות ההנדסה ממשיך לתמוך במערכות שהוא בונה, בתנאים שסוכמו. קראו על המעבדה ←

מתחילים מהמשימות שלכם ומהתקציב.

נברר יחד מה צריך למדוד ומה צריך לבנות.