Firma Tether Data udostępniła na licencji open source model wizyjno-językowy zawierający 460 milionów parametrów, zaprojektowany do działania bezpośrednio na smartfonach, bez konieczności korzystania z serwerów w chmurze.
Tether Data wypiera sztuczną inteligencję z chmury dzięki nowemu modelowi wizyjnemu o 460 mln parametrów

Najważniejsze informacje
- Jednostka QVAC firmy Tether udostępniła na licencji open source model wizualny o 460 milionach parametrów 29 lipca 2026 r.
- Model ten pokonał konkurentów z Liquid AI i Hugging Face w 16 z 17 testów porównawczych.
- Jego wersja Flash działała nawet 36 razy szybciej niż SmolVLM2-500M na telefonie iPhone 15.
VisionPsy-Nano, udostępniony w środę przez QVAC – dział badań nad sztuczną inteligencją firmy Tether – może analizować obrazy, dokumenty i wykresy, a następnie odpowiadać na pytania bez wysyłania materiałów źródłowych do zdalnego systemu. Telefon obsługuje zarówno dane wejściowe, jak i odpowiedzi, co pozwala oprogramowaniu działać w trybie offline i przechowywać dane na urządzeniu.
QVAC podaje, że model Tether AI Research osiągnął najwyższy ogólny wynik wśród systemów przetwarzania obrazu i języka posiadających mniej niż 500 milionów parametrów. W 17 testach porównawczych pokonał konkurencyjne modele w 16 z nich.
Jak wypada na tle konkurencji
Model uzyskał znormalizowany wynik 62,3, w porównaniu z 59,6 dla modelu LFM2.5-VL-450M firmy Liquid AI oraz 52,5 dla modelu SmolVLM2-500M firmy Hugging Face. Wcześniejszy model bazowy QVAC, nanoVLM-460M-8k, uzyskał wynik 54,9.
Wersja Tether Data jest dostępna w dwóch wariantach. Wersja standardowa stawia na dokładność, natomiast wersja Flash poświęca niewielką część jakości na rzecz szybszych odpowiedzi. QVAC twierdzi, że wersja Flash zachowuje około 99% wydajności pełnego modelu, generując jednocześnie pierwszy wynik nawet 23 razy szybciej niż SmolVLM2-500M na telefonach z systemem Android i nawet 36 razy szybciej na iPhonie 15.
Czas odpowiedzi ma znaczenie w przypadku urządzeń mobilnych. Kompaktowy model może osiągać dobre wyniki w testach, ale nadal wydawać się niepraktyczny, jeśli użytkownicy muszą czekać, aż urządzenie przetworzy obraz. Wersja Flash została zaprojektowana w celu skrócenia tego początkowego opóźnienia.
System sztucznej inteligencji (AI) obsługuje również analizę dokumentów i optyczne rozpoznawanie znaków, wyodrębniając tekst i strukturę ze sprawozdań finansowych, schematów blokowych i infografik.
QVAC twierdzi, że model ten pokonał konkurentów o podobnej wielkości średnio o 7,4% w testach rozumowania wizualnego. W testach MM-IFEval i POPE osiągnął również lepsze wyniki niż modele ponad dwukrotnie większe, w tym wersje opracowane przez Qwen i InternVL.
Dlaczego niewielkie rozmiary mają znaczenie
Przeniesienie przetwarzania obrazu z centrum danych do telefonu wiąże się z surowymi ograniczeniami dotyczącymi pamięci, wydzielania ciepła, zużycia baterii i mocy obliczeniowej. Kompaktowe modele często radzą sobie z tekstem zwykłym, ale tracą dokładność podczas odczytywania gęstych wykresów, tabel lub zeskanowanych dokumentów.
Wyniki testów porównawczych QVAC sugerują, że model zachował znaczną część tych możliwości, pozostając jednocześnie wystarczająco małym, by można go było zastosować w urządzeniach konsumenckich. Lokalne przetwarzanie oznacza również, że dokumenty nie muszą być przesyłane, a oprogramowanie może działać bez połączenia z siecią.
Stworzony z myślą o różnych opcjach wdrożenia
Programiści mogą uzyskać dostęp do modelu za pośrednictwem Hugging Face Transformers, kwantyzowanej wersji GGUF dla llama.cpp lub backendu vLLM przeznaczonego do zastosowań serwerowych o większej skali.
QVAC opublikowało również swoje konfiguracje testów porównawczych za pośrednictwem VLMEvalKit, umożliwiając zewnętrznym badaczom powtórzenie testów. Obie wersje są objęte licencją Apache 2.0, zezwalającą na wykorzystanie komercyjne, modyfikację i redystrybucję.
Część szerszej strategii Tether w zakresie sztucznej inteligencji
Dyrektor generalny Tether, Paolo Ardoino, stwierdził, że wydanie to wspiera dążenie firmy do tworzenia lokalnych, wydajnych systemów sztucznej inteligencji.
„Osiągnięcie najlepszej w swojej klasie jakości i wydajności w ogólnych zadaniach związanych z przetwarzaniem obrazu przy zaledwie 460 milionach parametrów dowodzi, że lokalna, wysoce wydajna sztuczna inteligencja jest realną ścieżką rozwoju” – powiedział Ardoino.
Model ten jest kolejnym z serii wydań QVAC sięgających października 2025 r., obejmujących syntetyczne zbiory danych szkoleniowych, wieloplatformowy zestaw narzędzi programistycznych oraz modele medyczne przeznaczone dla telefonów i urządzeń noszonych.
Dla programistów ta wersja oferuje analizę obrazów w trybie offline bez kosztów API związanych z wykorzystaniem. Firmy mogą przechowywać poufne dokumenty na urządzeniu, a konsumenci mogą korzystać z funkcji sztucznej inteligencji bez dostępu do sieci. Naukowcy mogą niezależnie zweryfikować deklarowaną przez firmę wydajność, korzystając z opublikowanych konfiguracji.
Tether sfinansował swoją ekspansję w dziedzinie sztucznej inteligencji zyskami z działalności związanej ze stablecoinem USDT. Zainwestował również w infrastrukturę sztucznej inteligencji, biotechnologię i robotykę, w tym w ramach rundy finansowania serii C w firmę NEURA Robotics o wartości do 1,4 mld dolarów.
Ten artykuł został przetłumaczony z języka angielskiego przy użyciu sztucznej inteligencji. Oryginalna wersja angielska jest źródłem autorytatywnym; tłumaczenia automatyczne mogą zawierać nieścisłości, zwłaszcza w terminologii prawnej i regulacyjnej.
















