Impulsado por
Technology

Tether Data saca la IA de la nube con un nuevo modelo de visión artificial de 460 millones de parámetros

Tether Data ha publicado en código abierto un modelo de visión y lenguaje con 460 millones de parámetros, diseñado para ejecutarse directamente en teléfonos inteligentes en lugar de depender de servidores en la nube.

ESCRITO POR
COMPARTIR
Tether Data saca la IA de la nube con un nuevo modelo de visión artificial de 460 millones de parámetros

Puntos clave

  • La unidad QVAC de Tether publicó en código abierto un modelo de visión con 460 millones de parámetros el 29 de julio de 2026.
  • El modelo superó a sus rivales de Liquid AI y Hugging Face en 16 de las 17 pruebas comparativas.
  • Su versión «Flash» funcionó hasta 36 veces más rápido que SmolVLM2-500M en un iPhone 15.

Lanzado el miércoles por QVAC, la división de investigación en IA de la empresa, VisionPsy-Nano puede examinar imágenes, documentos y gráficos, y luego responder a preguntas sin enviar el material original a un sistema remoto. El teléfono gestiona tanto la entrada como la respuesta, lo que permite que el software funcione sin conexión y mantenga los datos en el dispositivo.

Según QVAC, el modelo de Tether AI Research obtuvo la puntuación global más alta entre los sistemas de visión y lenguaje con menos de 500 millones de parámetros. De las 17 pruebas comparativas, superó a los modelos de la competencia en 16 de ellas.

Cómo se sitúa

El modelo obtuvo una puntuación normalizada de 62,3, frente a los 59,6 del LFM2.5-VL-450M de Liquid AI y los 52,5 del SmolVLM2-500M de Hugging Face. El modelo base anterior de QVAC, el nanoVLM-460M-8k, obtuvo una puntuación de 54,9. La versión de Tether Data está disponible en dos variantes. La versión estándar da prioridad a la precisión, mientras que la versión Flash sacrifica una pequeña parte de la calidad a cambio de respuestas más rápidas. QVAC afirma que la versión «Flash» conserva alrededor del 99 % del rendimiento del modelo completo, al tiempo que genera su primer resultado hasta 23 veces más rápido que el SmolVLM2-500M en teléfonos Android y hasta 36 veces más rápido en un iPhone 15. Ese tiempo de respuesta es importante en los dispositivos móviles. Un modelo compacto puede obtener buenos resultados en las pruebas, pero seguir resultando poco práctico si los usuarios tienen que esperar mientras el dispositivo procesa una imagen. Flash está diseñado para reducir ese retraso inicial. El sistema de inteligencia artificial (IA) también admite el análisis de documentos y el reconocimiento óptico de caracteres, extrayendo texto y estructura de informes financieros, diagramas de flujo e infografías.

QVAC afirma que el modelo superó a competidores de tamaño similar en una media del 7,4 % en pruebas de razonamiento visual. También superó a modelos que duplicaban con creces su tamaño en MM-IFEval y POPE, incluidas las versiones de Qwen e InternVL.

Por qué es importante el tamaño reducido

Trasladar el procesamiento de imágenes de un centro de datos a un teléfono impone límites estrictos en cuanto a memoria, calor, consumo de batería y potencia de cálculo. Los modelos compactos suelen gestionar texto sin formato, pero pierden precisión al leer gráficos densos, tablas o documentos escaneados.

Los resultados de las pruebas comparativas de QVAC sugieren que el modelo conservó gran parte de esa capacidad sin dejar de ser lo suficientemente pequeño para los dispositivos de consumo. El procesamiento local también significa que no es necesario subir los documentos, y que el software puede seguir funcionando sin conexión a la red.

Diseñado para varias opciones de implementación

Los desarrolladores pueden acceder al modelo a través de Hugging Face Transformers, una versión cuantificada de GGUF para llama.cpp o un backend vLLM para su uso en servidores de mayor volumen.

QVAC también ha publicado sus configuraciones de pruebas de rendimiento a través de VLMEvalKit, lo que permite a investigadores externos repetir las pruebas. Ambas versiones utilizan la licencia Apache 2.0, que permite el uso comercial, la modificación y la redistribución.

Parte de la estrategia más amplia de Tether en materia de IA

El director ejecutivo de Tether, Paolo Ardoino, afirmó que este lanzamiento respalda el impulso de la empresa hacia sistemas de IA locales y eficientes. «Lograr la mejor calidad y el mejor rendimiento de su clase en tareas generales de visión con tan solo 460 millones de parámetros demuestra que una IA altamente eficiente y que da prioridad a lo local es una vía viable», señaló Ardoino.

El modelo sigue a varios lanzamientos de QVAC que se remontan a octubre de 2025, entre los que se incluyen conjuntos de datos de entrenamiento sintéticos, un kit de desarrollo de software multiplataforma y modelos médicos diseñados para teléfonos y dispositivos wearables.

Para los desarrolladores, este lanzamiento ofrece análisis de imágenes sin conexión y sin costes de API basados en el uso. Las empresas pueden almacenar documentos confidenciales en el dispositivo, mientras que los consumidores pueden utilizar las funciones de IA sin necesidad de señal. Los investigadores pueden comprobar de forma independiente las afirmaciones de rendimiento de la empresa utilizando las configuraciones publicadas.

Tether ha financiado su expansión en el ámbito de la IA con los beneficios obtenidos de su negocio de la moneda estable USDT. También ha invertido en infraestructura de IA, biotecnología y robótica, incluida una inversión de la Serie C en NEURA Robotics valorada en hasta 1 400 millones de dólares.

Este artículo fue traducido del inglés mediante IA. La versión original en inglés es la fuente autorizada; las traducciones automáticas pueden contener imprecisiones, especialmente en la terminología legal y regulatoria.