Oferit de
Technology

Tether Data scoate IA din cloud cu un nou model de recunoaștere vizuală cu 460 de milioane de parametri

Tether Data a lansat ca open-source un model de vizualizare-limbaj cu 460 de milioane de parametri, conceput pentru a rula direct pe smartphone-uri, fără a mai depinde de serverele din cloud.

SCRIS DE
DISTRIBUIE
Tether Data scoate IA din cloud cu un nou model de recunoaștere vizuală cu 460 de milioane de parametri

Puncte cheie

  • Unitatea QVAC a companiei Tether a lansat ca open-source un model de vizualizare cu 460 de milioane de parametri pe 29 iulie 2026.
  • Modelul a depășit rivalii de la Liquid AI și Hugging Face în 16 din cele 17 teste de referință.
  • Versiunea sa „Flash” a rulat de până la 36 de ori mai repede decât SmolVLM2-500M pe un iPhone 15.

Lansat miercuri de divizia de cercetare în domeniul IA a companiei, QVAC, VisionPsy-Nano poate examina imagini, documente și grafice, apoi poate răspunde la întrebări fără a trimite materialul sursă către un sistem la distanță. Telefonul gestionează atât introducerea datelor, cât și răspunsul, permițând software-ului să funcționeze offline și să păstreze datele pe dispozitiv.

QVAC afirmă că modelul Tether AI Research a înregistrat cel mai mare scor general dintre sistemele de recunoaștere vizuală și limbaj cu mai puțin de 500 de milioane de parametri. Din cele 17 teste de performanță, acesta a depășit modelele concurente în 16 dintre ele.

Cum se situează

Modelul a obținut un scor normalizat de 62,3, comparativ cu 59,6 pentru LFM2.5-VL-450M de la Liquid AI și 52,5 pentru SmolVLM2-500M de la Hugging Face. Modelul de bază anterior al QVAC, nanoVLM-460M-8k, a obținut un scor de 54,9.

Versiunea Tether Data este disponibilă în două variante. Versiunea standard prioritizează acuratețea, în timp ce versiunea Flash renunță la o mică parte din calitate în favoarea unor răspunsuri mai rapide. QVAC afirmă că versiunea Flash păstrează aproximativ 99% din performanța modelului complet, generând în același timp primul rezultat de până la 23 de ori mai rapid decât SmolVLM2-500M pe telefoanele Android și de până la 36 de ori mai rapid pe un iPhone 15.

Timpul de răspuns este important pe dispozitivele mobile. Un model compact poate obține rezultate bune la teste, dar poate părea totuși nepractic dacă utilizatorii trebuie să aștepte în timp ce dispozitivul procesează o imagine. Versiunea Flash este concepută pentru a reduce această întârziere inițială.

Sistemul de inteligență artificială (IA) suportă, de asemenea, analiza documentelor și recunoașterea optică a caracterelor, extragând textul și structura din rapoarte financiare, diagrame de flux și infografice.

QVAC afirmă că modelul a depășit concurenții de dimensiuni similare cu o medie de 7,4% la testele de raționament vizual. De asemenea, a depășit modele de peste două ori mai mari decât el în testele MM-IFEval și POPE, inclusiv versiunile de la Qwen și InternVL.

De ce contează dimensiunea redusă

Mutarea procesării imaginilor dintr-un centru de date pe un telefon impune limite stricte în ceea ce privește memoria, căldura, consumul bateriei și puterea de calcul. Modelele compacte gestionează adesea textul simplu, dar își pierd precizia atunci când citesc diagrame complexe, tabele sau documente scanate.

Rezultatele testelor de performanță ale QVAC sugerează că modelul și-a păstrat o mare parte din această capacitate, rămânând în același timp suficient de mic pentru dispozitivele de larg consum. Prelucrarea locală înseamnă, de asemenea, că documentele nu trebuie încărcate, iar software-ul poate continua să funcționeze fără o conexiune la rețea.

Conceput pentru mai multe opțiuni de implementare

Dezvoltatorii pot accesa modelul prin Hugging Face Transformers, o versiune cuantificată GGUF pentru llama.cpp sau un backend vLLM pentru utilizarea pe servere cu volum mai mare.

QVAC a publicat, de asemenea, configurațiile sale de testare comparativă prin intermediul VLMEvalKit, permițând cercetătorilor externi să repete testele. Ambele versiuni utilizează licența Apache 2.0, care permite utilizarea comercială, modificarea și redistribuirea.

Parte a strategiei mai ample a Tether în domeniul IA

Paolo Ardoino, CEO-ul Tether, a declarat că această lansare susține eforturile companiei de a dezvolta sisteme de IA locale și eficiente.

„Atingerea unei calități și a unei performanțe de top în sarcinile generale de recunoaștere vizuală cu doar 460 de milioane de parametri dovedește că o IA locală și extrem de eficientă reprezintă o cale viabilă”, a afirmat Ardoino.

Modelul urmează mai multor lansări QVAC începând din octombrie 2025, inclusiv seturi de date sintetice de antrenare, un kit de dezvoltare software multiplataformă și modele medicale concepute pentru telefoane și dispozitive purtabile.

Pentru dezvoltatori, această versiune oferă analiza imaginilor offline, fără costuri API bazate pe utilizare. Companiile pot păstra documentele confidențiale pe dispozitiv, în timp ce consumatorii pot utiliza funcțiile de IA fără a avea nevoie de semnal. Cercetătorii pot testa în mod independent afirmațiile companiei privind performanța, folosind configurațiile publicate.

Tether și-a finanțat expansiunea în domeniul IA cu profiturile obținute din activitatea sa legată de moneda stabilă USDT. De asemenea, a investit în infrastructura de IA, biotehnologie și robotică, inclusiv o investiție de serie C în NEURA Robotics, evaluată la până la 1,4 miliarde de dolari.

Acest articol a fost tradus din limba engleză cu ajutorul inteligenței artificiale. Versiunea originală în limba engleză este sursa autoritară; traducerile automate pot conține inexactități, în special în terminologia juridică și de reglementare.