Offerto da
Technology

Tether Data porta l'IA fuori dal cloud con un nuovo modello di visione artificiale da 460 milioni di parametri

Tether Data ha reso open source un modello di visione-linguaggio da 460 milioni di parametri, progettato per funzionare direttamente sugli smartphone senza ricorrere ai server cloud.

SCRITTO DA
CONDIVIDI
Tether Data porta l'IA fuori dal cloud con un nuovo modello di visione artificiale da 460 milioni di parametri

Punti chiave

  • Il 29 luglio 2026, l’unità QVAC di Tether ha reso open source un modello di visione con 460 milioni di parametri.
  • Il modello ha superato i concorrenti Liquid AI e Hugging Face in 16 dei 17 test di benchmark.
  • La sua versione Flash ha funzionato fino a 36 volte più velocemente di SmolVLM2-500M su un iPhone 15.

Rilasciato mercoledì dalla divisione di ricerca sull’IA dell’azienda, QVAC, VisionPsy-Nano è in grado di esaminare immagini, documenti e grafici, per poi rispondere alle domande senza inviare il materiale di origine a un sistema remoto. Il telefono gestisce sia l’input che la risposta, consentendo al software di funzionare offline e di conservare i dati sul dispositivo.

QVAC afferma che il modello di Tether AI Research ha registrato il punteggio complessivo più alto tra i sistemi di visione-linguaggio con meno di 500 milioni di parametri. Su 17 benchmark, ha superato i modelli concorrenti in 16 casi.

Come si posiziona

Il modello ha ottenuto un punteggio normalizzato di 62,3, rispetto al 59,6 dell’LFM2.5-VL-450M di Liquid AI e al 52,5 dello SmolVLM2-500M di Hugging Face. Il precedente modello di base nanoVLM-460M-8k di QVAC aveva ottenuto un punteggio di 54,9. La versione di Tether Data è disponibile in due varianti. La build standard privilegia l’accuratezza, mentre la versione Flash sacrifica leggermente la qualità a favore di risposte più rapide. QVAC afferma che la versione Flash mantiene circa il 99% delle prestazioni del modello completo, producendo al contempo il primo risultato fino a 23 volte più velocemente rispetto a SmolVLM2-500M su telefoni Android e fino a 36 volte più velocemente su un iPhone 15. Il tempo di risposta è fondamentale sull’hardware mobile. Un modello compatto può ottenere buoni risultati nei test, ma risultare comunque poco pratico se gli utenti devono attendere mentre il dispositivo elabora un’immagine. La versione Flash è progettata per ridurre quel ritardo iniziale. Il sistema di intelligenza artificiale (IA) supporta anche l’analisi dei documenti e il riconoscimento ottico dei caratteri, estraendo testo e struttura da relazioni finanziarie, diagrammi di flusso e infografiche.

QVAC afferma che il modello ha superato i concorrenti di dimensioni simili di una media del 7,4% nei test di ragionamento visivo. Ha inoltre superato modelli di dimensioni più che doppie rispetto alle sue su MM-IFEval e POPE, incluse le versioni di Qwen e InternVL.

Perché l’ingombro ridotto è importante

Spostare l’elaborazione delle immagini da un data center a uno smartphone comporta limiti rigorosi in termini di memoria, surriscaldamento, consumo della batteria e potenza di calcolo. I modelli compatti spesso gestiscono il testo semplice, ma perdono precisione nella lettura di grafici complessi, tabelle o documenti digitalizzati.

I risultati dei benchmark di QVAC suggeriscono che il modello abbia conservato gran parte di tale capacità pur rimanendo sufficientemente piccolo per i dispositivi di consumo. L’elaborazione locale implica inoltre che non sia necessario caricare i documenti e che il software possa continuare a funzionare senza una connessione di rete.

Progettato per diverse opzioni di implementazione

Gli sviluppatori possono accedere al modello tramite Hugging Face Transformers, una versione quantizzata di GGUF per llama.cpp o un backend vLLM per l’utilizzo su server ad alto volume.

QVAC ha inoltre pubblicato le proprie configurazioni di benchmark tramite VLMEvalKit, consentendo ai ricercatori esterni di ripetere i test. Entrambe le versioni utilizzano la licenza Apache 2.0, che consente l’uso commerciale, la modifica e la ridistribuzione.

Parte della più ampia strategia di Tether nel campo dell’IA

Il CEO di Tether, Paolo Ardoino, ha affermato che questo rilascio sostiene l’impegno dell’azienda verso sistemi di IA locali ed efficienti. “Il raggiungimento di qualità e prestazioni ai vertici della categoria in compiti di visione generale con soli 460 milioni di parametri dimostra che un’IA altamente efficiente e incentrata sul locale rappresenta una strada percorribile”, ha dichiarato Ardoino.

Il modello fa seguito a diverse versioni di QVAC risalenti a ottobre 2025, tra cui set di dati di addestramento sintetici, un kit di sviluppo software multipiattaforma e modelli medici progettati per telefoni e dispositivi indossabili.

Per gli sviluppatori, questa versione offre l’analisi delle immagini offline senza costi API legati all’utilizzo. Le aziende possono conservare documenti sensibili sul dispositivo, mentre i consumatori possono utilizzare le funzionalità di IA anche in assenza di segnale. I ricercatori possono verificare in modo indipendente le affermazioni dell’azienda relative alle prestazioni utilizzando le configurazioni pubblicate.

Tether ha finanziato la propria espansione nel campo dell’IA con i profitti derivanti dalla propria attività legata alla stablecoin USDT. Ha inoltre investito in infrastrutture di IA, biotecnologie e robotica, compreso un investimento di Serie C in NEURA Robotics del valore massimo di 1,4 miliardi di dollari.

Questo articolo è stato tradotto dall'inglese tramite IA. La versione originale in inglese è la fonte autorevole; le traduzioni automatiche possono contenere imprecisioni, in particolare nella terminologia legale e normativa.