Működteti
Technology

A Tether Data új, 460 millió paraméteres képfeldolgozó modelljével kiszorítja a mesterséges intelligenciát a felhőből

A Tether Data nyílt forráskódúvá tette azt a 460 millió paramétert tartalmazó kép-nyelvi modellt, amelyet úgy fejlesztettek ki, hogy közvetlenül okostelefonokon futtatható legyen, a felhőszerverek igénybevétele nélkül.

MEGOSZTÁS
A Tether Data új, 460 millió paraméteres képfeldolgozó modelljével kiszorítja a mesterséges intelligenciát a felhőből

Főbb megállapítások

  • A Tether QVAC részlege 2026. július 29-én nyílt forráskódúvá tett egy 460 millió paraméteres képfeldolgozó modellt.
  • A modell a 17 benchmark-tesztből 16-ban felülmúlta a Liquid AI és a Hugging Face versenytársait.
  • Flash verziója akár 36-szor gyorsabban futott, mint a SmolVLM2-500M egy iPhone 15-ön.

A vállalat mesterséges intelligencia kutató részlege, a QVAC által szerdán bemutatott VisionPsy-Nano képes képeket, dokumentumokat és táblázatokat elemezni, majd kérdésekre válaszolni anélkül, hogy a forrásanyagot távoli rendszerre küldené. A telefon kezeli mind a bemeneti adatokat, mind a válaszokat, így a szoftver offline módban is működhet, és az adatokat a készüléken tárolja.

A QVAC szerint a Tether AI Research modellje a legmagasabb összesített pontszámot érte el az 500 millió paraméternél kevesebbel rendelkező kép-nyelv rendszerek között. A 17 teljesítményteszt közül 16-ban felülmúlta a versenytárs modelleket.

Hogyan teljesít?

A modell normalizált pontszáma 62,3 volt, szemben a Liquid AI LFM2.5-VL-450M modelljének 59,6-os és a Hugging Face SmolVLM2-500M modelljének 52,5-ös pontszámával. A QVAC korábbi nanoVLM-460M-8k alapmodellje 54,9 pontot ért el.

A Tether Data két változatban jelenik meg. A standard változat a pontosságot helyezi előtérbe, míg a Flash a gyorsabb válaszok érdekében kis mértékben feláldozza a minőséget. A QVAC szerint a Flash a teljes modell teljesítményének körülbelül 99%-át megőrzi, miközben az első kimenetet Android-telefonokon akár 23-szor, iPhone 15-ön pedig akár 36-szor gyorsabban állítja elő, mint a SmolVLM2-500M.

Ez a válaszidő mobil eszközökön különösen fontos. Egy kompakt modell jól teljesíthet a tesztekben, de mégis használhatatlannak tűnhet, ha a felhasználóknak várniuk kell, amíg a készülék feldolgozza a képet. A Flash-t úgy tervezték, hogy csökkentse ezt a kezdeti késleltetést.

A mesterséges intelligencia (AI) rendszer emellett támogatja a dokumentumelemzést és az optikai karakterfelismerést is, szöveget és szerkezetet kivonva pénzügyi jelentésekből, folyamatábrákból és infografikákból.

A QVAC szerint a modell a vizuális érvelési teszteken átlagosan 7,4%-kal felülmúlta a hasonló méretű versenytársakat. Emellett az MM-IFEval és a POPE teszteken is felülmúlta a méretének több mint kétszeresét kitevő modelleket, beleértve a Qwen és az InternVL kiadásait is.

Miért fontos a kis méret?

A képfeldolgozás áthelyezése az adatközpontból a telefonra szigorú korlátokat szab a memóriára, a hőtermelésre, az akkumulátor-használatra és a számítási teljesítményre. A kompakt modellek gyakran képesek feldolgozni a sima szöveget, de pontosságukat veszítik, amikor sűrű diagramokat, táblázatokat vagy beolvasott dokumentumokat olvasnak.

A QVAC benchmark-eredményei arra utalnak, hogy a modell megőrizte e képességek nagy részét, miközben elég kicsi maradt a fogyasztói eszközökhöz. A helyi feldolgozás azt is jelenti, hogy a dokumentumokat nem kell feltölteni, és a szoftver hálózati kapcsolat nélkül is folytathatja a munkát.

Többféle telepítési lehetőségre tervezve

A fejlesztők a Hugging Face Transformersen, a llama.cpp kvantált GGUF-verzióján vagy a nagyobb forgalmú szerveres használatra szánt vLLM-háttérrendszeren keresztül érhetik el a modellt.

A QVAC a VLMEvalKit segítségével közzétette a teljesítményteszt-konfigurációit is, lehetővé téve külső kutatók számára a tesztek megismétlését. Mindkét verzió az Apache 2.0 licencet használja, amely engedélyezi a kereskedelmi felhasználást, a módosítást és a továbbterjesztést.

A Tether átfogóbb AI-stratégiájának része

Paolo Ardoino, a Tether vezérigazgatója elmondta, hogy a kiadás támogatja a vállalat törekvését a helyi, hatékony AI-rendszerek irányába.

„Az, hogy mindössze 460 millió paraméterrel sikerült a kategóriájában legjobb minőséget és teljesítményt elérni általános képfeldolgozási feladatoknál, bizonyítja, hogy a helyi elsődlegességet előtérbe helyező, rendkívül hatékony AI megvalósítható út” – mondta Ardoino.

A modell a 2025 októberétől megjelent számos QVAC-kiadást követi, amelyek között szerepelnek szintetikus edzésadatkészletek, egy platformok közötti szoftverfejlesztő készlet, valamint okostelefonokra és hordható eszközökre tervezett orvosi modellek.

A fejlesztők számára a kiadás offline képelemzést kínál, használat alapú API-költségek nélkül. A vállalkozások az érzékeny dokumentumokat az eszközön tárolhatják, míg a fogyasztók jel nélkül is használhatják a mesterséges intelligencia funkcióit. A kutatók a közzétett konfigurációk segítségével függetlenül tesztelhetik a vállalat teljesítményre vonatkozó állításait.

A Tether az USDT stabilcoin-üzletágából származó nyereségből finanszírozta mesterséges intelligencia terén történő terjeszkedését. Emellett befektetett a mesterséges intelligencia infrastruktúrájába, a biotechnológiába és a robotikába is, ideértve a NEURA Roboticsba irányuló, akár 1,4 milliárd dollár értékű C-sorozatú befektetést is.

Ezt a cikket mesterséges intelligencia segítségével fordították le angolról. Az eredeti angol nyelvű változat a hiteles forrás; az automatikus fordítások pontatlanságokat tartalmazhatnak, különösen a jogi és szabályozási terminológiában.