Aangedreven door
Technology

Tether Data haalt AI uit de cloud met een nieuw visiemodel met 460 miljoen parameters

Tether Data heeft een visie-taalmodel met 460 miljoen parameters als open source vrijgegeven; dit model is zo ontworpen dat het rechtstreeks op smartphones draait, in plaats van afhankelijk te zijn van cloudservers.

GESCHREVEN DOOR
DELEN
Tether Data haalt AI uit de cloud met een nieuw visiemodel met 460 miljoen parameters

Belangrijkste punten

  • De QVAC-afdeling van Tether heeft op 29 juli 2026 een visiemodel met 460 miljoen parameters als open source vrijgegeven.
  • Het model presteerde beter dan concurrenten van Liquid AI en Hugging Face in 16 van de 17 benchmarktests.
  • De Flash-versie werkte tot wel 36 keer sneller dan SmolVLM2-500M op een iPhone 15.

VisionPsy-Nano, dat woensdag werd uitgebracht door QVAC, de AI-onderzoeksafdeling van het bedrijf, kan afbeeldingen, documenten en grafieken analyseren en vervolgens vragen beantwoorden zonder het bronmateriaal naar een extern systeem te sturen. De telefoon verwerkt zowel de invoer als het antwoord, waardoor de software offline kan werken en de gegevens op het apparaat blijven.

Volgens QVAC behaalde het model van Tether AI Research de hoogste totaalscore onder vision-language-systemen met minder dan 500 miljoen parameters. Van de 17 benchmarks versloeg het in 16 gevallen concurrerende modellen.

Hoe het zich verhoudt

Het model behaalde een genormaliseerde score van 62,3, vergeleken met 59,6 voor de LFM2.5-VL-450M van Liquid AI en 52,5 voor de SmolVLM2-500M van Hugging Face. Het eerdere basismodel nanoVLM-460M-8k van QVAC scoorde 54,9.

De release van Tether Data is beschikbaar in twee versies. De standaardversie geeft prioriteit aan nauwkeurigheid, terwijl Flash een klein beetje kwaliteit inlevert voor snellere reacties. Volgens QVAC behoudt Flash ongeveer 99% van de prestaties van het volledige model, terwijl de eerste output tot 23 keer sneller wordt gegenereerd dan bij de SmolVLM2-500M op Android-telefoons en tot 36 keer sneller op een iPhone 15.

Die responstijd is van belang op mobiele apparaten. Een compact model kan goed scoren in tests, maar toch onpraktisch aanvoelen als gebruikers moeten wachten terwijl het apparaat een afbeelding verwerkt. Flash is ontworpen om die aanvankelijke vertraging te verminderen.

Het kunstmatige-intelligentie (AI)-systeem ondersteunt ook documentanalyse en optische tekenherkenning, waarbij tekst en structuur worden geëxtraheerd uit financiële rapporten, stroomdiagrammen en infographics.

Volgens QVAC presteerde het model bij visuele redeneringstests gemiddeld 7,4% beter dan concurrenten van vergelijkbare omvang. Het presteerde ook beter dan modellen die meer dan twee keer zo groot waren op MM-IFEval en POPE, waaronder releases van Qwen en InternVL.

Waarom de kleine omvang belangrijk is

Het verplaatsen van beeldverwerking van een datacenter naar een telefoon brengt strenge beperkingen met zich mee op het gebied van geheugen, warmteontwikkeling, batterijverbruik en rekenkracht. Compacte modellen kunnen vaak wel omgaan met platte tekst, maar verliezen aan nauwkeurigheid bij het lezen van gedetailleerde grafieken, tabellen of gescande documenten.

De benchmarkresultaten van QVAC wijzen erop dat het model een groot deel van die capaciteit heeft behouden, terwijl het klein genoeg is gebleven voor consumentenapparaten. Lokale verwerking betekent ook dat documenten niet hoeven te worden geüpload en dat de software kan blijven werken zonder netwerkverbinding.

Ontworpen voor verschillende implementatiemogelijkheden

Ontwikkelaars hebben toegang tot het model via Hugging Face Transformers, een gekwantiseerde GGUF-versie voor llama.cpp of een vLLM-backend voor gebruik op servers met een hoger verwerkingsvolume.

QVAC heeft ook zijn benchmarkconfiguraties gepubliceerd via VLMEvalKit, waardoor externe onderzoekers de tests kunnen herhalen. Beide versies maken gebruik van de Apache 2.0-licentie, die commercieel gebruik, aanpassing en herdistributie toestaat.

Onderdeel van de bredere AI-strategie van Tether

Paolo Ardoino, CEO van Tether, zei dat de release het streven van het bedrijf naar lokale, efficiënte AI-systemen ondersteunt.

“Het behalen van toonaangevende kwaliteit en prestaties bij algemene visietaken met slechts 460 miljoen parameters bewijst dat lokale, zeer efficiënte AI een haalbare weg is,” aldus Ardoino.

Het model volgt op verschillende QVAC-releases die teruggaan tot oktober 2025, waaronder synthetische trainingsdatasets, een platformonafhankelijke softwareontwikkelingskit en medische modellen die zijn ontworpen voor telefoons en draagbare apparaten.

Voor ontwikkelaars biedt de release offline beeldanalyse zonder API-kosten op basis van gebruik. Bedrijven kunnen gevoelige documenten op het apparaat bewaren, terwijl consumenten AI-functies kunnen gebruiken zonder signaal. Onderzoekers kunnen de prestatieclaims van het bedrijf onafhankelijk toetsen aan de hand van de gepubliceerde configuraties.

Tether heeft zijn AI-uitbreiding gefinancierd met winsten uit zijn USDT-stablecoin-activiteiten. Het heeft ook geïnvesteerd in AI-infrastructuur, biotechnologie en robotica, waaronder een Serie C-investering in NEURA Robotics met een waarde van maximaal 1,4 miljard dollar.

Dit artikel is met behulp van AI uit het Engels vertaald. De originele Engelstalige versie is de gezaghebbende bron; geautomatiseerde vertalingen kunnen onnauwkeurigheden bevatten, met name in juridische en regelgevende terminologie.