מופעל ע"י
Technology

נתוני Tether דוחפים את הבינה המלאכותית אל מחוץ לענן עם מודל ראייה חדש בעל 460 מיליון פרמטרים

Tether Data הפכה לקוד פתוח מודל ראייה-שפה עם 460 מיליון פרמטרים, שנבנה כדי לרוץ ישירות על סמארטפונים במקום להסתמך על שרתי ענן.

נכתב ע"י
שתף
נתוני Tether דוחפים את הבינה המלאכותית אל מחוץ לענן עם מודל ראייה חדש בעל 460 מיליון פרמטרים

נקודות עיקריות

  • יחידת QVAC של Tether פתחה לקוד פתוח מודל ראייה עם 460 מיליון פרמטרים ב-29 ביולי 2026.
  • המודל גבר על מתחרים של Liquid AI ושל Hugging Face ב-16 מתוך 17 מבחני בנצ’מרק.
  • גרסת ה-Flash שלו רצה עד פי 36 מהר יותר מ-Sm olVLM2-500M על iPhone 15.

שוחרר ביום רביעי על ידי זרוע מחקר הבינה המלאכותית של החברה, QVAC, VisionPsy-Nano יכול לבחון תמונות, מסמכים ותרשימים, ואז לענות על שאלות מבלי לשלוח את חומר המקור למערכת מרוחקת. הטלפון מטפל גם בקלט וגם בתשובה, מה שמאפשר לתוכנה לפעול במצב לא מקוון ולשמור את הנתונים על המכשיר.

QVAC אומרת שהמודל של Tether AI Research רשם את הציון הכולל הגבוה ביותר מבין מערכות ראייה-שפה עם פחות מ-500 מיליון פרמטרים. לאורך 17 בנצ’מרקים, הוא גבר על מודלים מתחרים ב-16.

איך הוא משתווה

המודל השיג ציון מנורמל של 62.3, לעומת 59.6 עבור LFM2.5-VL-450M של Liquid AI ו-52.5 עבור SmolVLM2-500M של Hugging Face. מודל הבסיס nanoVLM-460M-8k הקודם של QVAC קיבל 54.9.

המהדורה של Tether Data מגיעה בשתי גרסאות. הבנייה הסטנדרטית נותנת עדיפות לדיוק, בעוד Flash מוותרת על מעט איכות לטובת תגובות מהירות יותר. QVAC אומרת ש-Flash שומרת על כ-99% מביצועי המודל המלא, תוך שהיא מפיקה את הפלט הראשון שלה עד פי 23 מהר יותר מ-Sm olVLM2-500M בטלפוני אנדרואיד ועד פי 36 מהר יותר ב-iPhone 15.

זמן התגובה הזה חשוב בחומרת מובייל. מודל קומפקטי יכול לקבל ציון גבוה בבדיקות ועדיין להרגיש לא פרקטי אם משתמשים חייבים להמתין בזמן שהמכשיר מעבד תמונה. Flash נועדה לצמצם את ההשהיה הראשונית הזו.

מערכת הבינה המלאכותית (AI) תומכת גם בניתוח מסמכים ובזיהוי תווים אופטי, ומחלצת טקסט ומבנה מדוחות פיננסיים, תרשימי זרימה ואינפוגרפיקות.

QVAC אומרת שהמודל גבר על מתחרים בגודל דומה בממוצע של 7.4% במבחני היסק חזותי. הוא גם התעלה על מודלים שגודלם יותר מכפול משלו ב-MM-IFEval וב-POPE, כולל שחרורים מ-Qwen ומ-InternVL.

מדוע טביעת הרגל הקטנה חשובה

העברת עיבוד תמונה ממרכז נתונים לטלפון מציבה מגבלות נוקשות סביב זיכרון, חום, שימוש בסוללה וכוח חישוב. מודלים קומפקטיים לעיתים קרובות מתמודדים היטב עם טקסט פשוט, אך מאבדים דיוק בעת קריאת תרשימים צפופים, טבלאות או מסמכים סרוקים.

תוצאות הבנצ’מרק של QVAC מרמזות שהמודל שימר חלק גדול מהיכולת הזו תוך שהוא נותר קטן מספיק עבור מכשירי צרכנים. עיבוד מקומי גם אומר שאין צורך להעלות מסמכים, והתוכנה יכולה להמשיך לעבוד ללא חיבור לרשת.

נבנה למספר אפשרויות פריסה

מפתחים יכולים לגשת למודל דרך Hugging Face Transformers, גרסת GGUF מכומתת עבור llama.cpp או backend של vLLM לשימוש בשרתים בנפח גבוה יותר.

QVAC גם פרסמה את תצורות הבנצ’מרק שלה דרך VLMEvalKit, מה שמאפשר לחוקרים חיצוניים לחזור על הבדיקות. שתי הגרסאות משתמשות ברישיון Apache 2.0, המתיר שימוש מסחרי, שינוי והפצה מחדש.

חלק מאסטרטגיית ה-AI הרחבה של Tether

מנכ”ל Tether, פאולו ארדואינו אמר שהשחרור תומך בדחיפה של החברה לעבר מערכות AI מקומיות ויעילות.

“להשיג איכות וביצועים מהטובים מסוגם במשימות ראייה כלליות עם רק 460 מיליון פרמטרים מוכיח ש-AI יעיל מאוד ומקומי-תחילה הוא נתיב בר-קיימא,” אמר ארדואינו.

המודל מגיע בעקבות כמה שחרורים של QVAC מאז אוקטובר 2025, כולל מערכי נתונים סינתטיים לאימון, ערכת פיתוח תוכנה חוצת פלטפורמות, ומודלים רפואיים שנועדו לטלפונים ולמכשירים לבישים.

עבור מפתחים, השחרור מציע ניתוח תמונה לא מקוון ללא עלויות API מבוססות שימוש. עסקים יכולים לשמור מסמכים רגישים על המכשיר, בעוד צרכנים יכולים להשתמש בתכונות AI ללא קליטה. חוקרים יכולים לבדוק באופן עצמאי את טענות הביצועים של החברה באמצעות התצורות שפורסמו.

Tether מימנה את הרחבת ה-AI שלה באמצעות רווחים מעסק הסטייבלקוין USDT שלה. היא גם השקיעה בתשתיות AI, בביוטכנולוגיה וברובוטיקה, כולל השקעת סבב C ב-NEURA Robotics בשווי של עד 1.4 מיליארד דולר.

מאמר זה תורגם מאנגלית באמצעות בינה מלאכותית. הגרסה המקורית באנגלית היא המקור הקובע; תרגומים אוטומטיים עשויים להכיל אי-דיוקים, במיוחד במונחים משפטיים ורגולטוריים.