Propulsé par
Technology

Tether Data fait sortir l'IA du cloud grâce à un nouveau modèle de vision artificielle comptant 460 millions de paramètres

Tether Data a mis en open source un modèle de vision et de langage comportant 460 millions de paramètres, conçu pour fonctionner directement sur les smartphones plutôt que de dépendre de serveurs cloud.

ÉCRIT PAR
PARTAGER
Tether Data fait sortir l'IA du cloud grâce à un nouveau modèle de vision artificielle comptant 460 millions de paramètres

Points clés

  • L'unité QVAC de Tether a mis en open source un modèle de vision comptant 460 millions de paramètres le 29 juillet 2026.
  • Ce modèle a surpassé ses concurrents de Liquid AI et Hugging Face dans 16 des 17 tests de référence.
  • Sa version « Flash » s’est avérée jusqu’à 36 fois plus rapide que SmolVLM2-500M sur un iPhone 15.

Lancé mercredi par QVAC, la branche de recherche en IA de l’entreprise, VisionPsy-Nano est capable d’analyser des images, des documents et des graphiques, puis de répondre à des questions sans envoyer les données sources vers un système distant. Le téléphone gère à la fois la saisie et la réponse, ce qui permet au logiciel de fonctionner hors ligne et de conserver les données sur l’appareil.

Selon QVAC, le modèle de Tether AI Research a enregistré le meilleur score global parmi les systèmes de vision-langage comptant moins de 500 millions de paramètres. Sur les 17 tests de performance, il a surpassé les modèles concurrents dans 16 d’entre eux.

Comment se positionne-t-il ?

Le modèle a affiché un score normalisé de 62,3, contre 59,6 pour le LFM2.5-VL-450M de Liquid AI et 52,5 pour le SmolVLM2-500M de Hugging Face. Le modèle de base précédent de QVAC, le nanoVLM-460M-8k, avait obtenu un score de 54,9. La version Tether Data est disponible en deux variantes. La version standard privilégie la précision, tandis que la version Flash sacrifie légèrement la qualité au profit de réponses plus rapides. Selon QVAC, la version Flash conserve environ 99 % des performances du modèle complet tout en produisant son premier résultat jusqu’à 23 fois plus rapidement que le SmolVLM2-500M sur les téléphones Android et jusqu’à 36 fois plus rapidement sur un iPhone 15. Ce temps de réponse est crucial sur les appareils mobiles. Un modèle compact peut obtenir de bons résultats lors des tests, mais rester peu pratique si les utilisateurs doivent attendre que l’appareil traite une image. La version Flash est conçue pour réduire ce délai initial. Ce système d’intelligence artificielle (IA) prend également en charge l’analyse de documents et la reconnaissance optique de caractères, en extrayant le texte et la structure de rapports financiers, d’organigrammes et d’infographies.

Selon QVAC, le modèle a surpassé ses concurrents de taille similaire de 7,4 % en moyenne lors des tests de raisonnement visuel. Il a également surpassé des modèles plus de deux fois plus volumineux sur MM-IFEval et POPE, y compris les versions de Qwen et d’InternVL.

Pourquoi la petite taille est-elle importante ?

Le transfert du traitement d’images d’un centre de données vers un téléphone impose des contraintes strictes en matière de mémoire, de dissipation thermique, d’autonomie de la batterie et de puissance de calcul. Les modèles compacts traitent souvent le texte brut, mais perdent en précision lorsqu’ils doivent lire des graphiques complexes, des tableaux ou des documents numérisés.

Les résultats des tests de performance de QVAC suggèrent que le modèle a conservé une grande partie de cette capacité tout en restant suffisamment compact pour les appareils grand public. Le traitement local signifie également que les documents n’ont pas besoin d’être téléchargés et que le logiciel peut continuer à fonctionner sans connexion réseau.

Conçu pour plusieurs options de déploiement

Les développeurs peuvent accéder au modèle via Hugging Face Transformers, une version quantifiée de GGUF pour llama.cpp ou un backend vLLM destiné à une utilisation sur des serveurs à haut débit.

QVAC a également publié ses configurations de benchmark via VLMEvalKit, permettant ainsi à des chercheurs externes de reproduire les tests. Les deux versions sont sous licence Apache 2.0, qui autorise l’utilisation commerciale, la modification et la redistribution.

S’inscrit dans la stratégie plus large de Tether en matière d’IA

Paolo Ardoino, PDG de Tether, a déclaré que cette publication s’inscrit dans la volonté de l’entreprise de se tourner vers des systèmes d’IA locaux et efficaces. « Atteindre une qualité et des performances de premier ordre sur des tâches de vision générale avec seulement 460 millions de paramètres prouve qu’une IA hautement efficace et privilégiant le local est une voie viable », a déclaré M. Ardoino.

Ce modèle fait suite à plusieurs versions de QVAC publiées depuis octobre 2025, notamment des ensembles de données d’entraînement synthétiques, un kit de développement logiciel multiplateforme et des modèles médicaux conçus pour les téléphones et les appareils portables.

Pour les développeurs, cette version offre une analyse d’images hors ligne sans frais d’API liés à l’utilisation. Les entreprises peuvent conserver des documents sensibles sur l’appareil, tandis que les consommateurs peuvent utiliser les fonctionnalités d’IA sans connexion réseau. Les chercheurs peuvent tester de manière indépendante les performances annoncées par l’entreprise à l’aide des configurations publiées.

Tether a financé son expansion dans le domaine de l’IA grâce aux bénéfices tirés de son activité de stablecoin USDT. L’entreprise a également investi dans les infrastructures d’IA, la biotechnologie et la robotique, notamment via un investissement de série C dans NEURA Robotics évalué à 1,4 milliard de dollars.

Cet article a été traduit de l'anglais à l'aide de l'IA. La version originale en anglais fait foi ; les traductions automatiques peuvent contenir des inexactitudes, en particulier dans la terminologie juridique et réglementaire.