Pinapagana ng
Technology

Itinutulak ng Tether Data ang AI Palayo sa Cloud Gamit ang Bagong 460M-Parameter na Vision Model

Ginawang open-source ng Tether Data ang isang 460-milyong-parameter na vision-language model na idinisenyong tumakbo mismo sa mga smartphone sa halip na umasa sa mga cloud server.

ISINULAT NI
IBAHAGI
Itinutulak ng Tether Data ang AI Palayo sa Cloud Gamit ang Bagong 460M-Parameter na Vision Model

Mga Pangunahing Takeaway

  • Ginawang open-source ng yunit ng QVAC ng Tether ang isang 460-milyong-parameter na vision model noong Hulyo 29, 2026.
  • Nilampasan ng modelo ang mga karibal mula Liquid AI at Hugging Face sa 16 sa 17 benchmark na pagsusulit.
  • Ang Flash na bersyon nito ay tumakbo nang hanggang 36 na beses na mas mabilis kaysa SmolVLM2-500M sa isang iPhone 15.

Inilabas noong Miyerkules ng AI research arm ng kumpanya, ang QVAC, ang VisionPsy-Nano ay kayang magsuri ng mga larawan, dokumento, at tsart, at saka sumagot ng mga tanong nang hindi ipinapadala ang pinagmumulan na materyal sa isang malayuang sistema. Ang telepono ang humahawak kapwa ng input at tugon, kaya nakakapag-operate ang software nang offline at nananatili ang datos sa device.

Ayon sa QVAC, nakapagtala ang modelo ng Tether AI Research ng pinakamataas na kabuuang iskor sa hanay ng mga vision-language system na may mas mababa sa 500 milyong parameter. Sa 17 benchmark, tinalo nito ang mga katunggaling modelo sa 16.

Paano Ito Naghahambing

Nagtala ang modelo ng normalized score na 62.3, kumpara sa 59.6 para sa LFM2.5-VL-450M ng Liquid AI at 52.5 para sa SmolVLM2-500M ng Hugging Face. Ang naunang nanoVLM-460M-8k base model ng QVAC ay nakakuha ng 54.9.

Ang paglabas ng Tether Data ay dumarating sa dalawang bersyon. Inuuna ng standard build ang katumpakan, habang ang Flash ay nagsasakripisyo ng kaunting kalidad kapalit ng mas mabilis na mga tugon. Ayon sa QVAC, napapanatili ng Flash ang humigit-kumulang 99% ng performance ng buong modelo habang naihahatid ang unang output nito nang hanggang 23 beses na mas mabilis kaysa SmolVLM2-500M sa mga Android phone at hanggang 36 na beses na mas mabilis sa isang iPhone 15.

Mahalaga ang oras ng pagtugon na iyon sa mobile hardware. Maaaring maganda ang puntos ng isang compact na modelo sa testing pero maging hindi praktikal pa rin kung kailangang maghintay ang mga user habang pinoproseso ng device ang isang larawan. Dinisenyo ang Flash upang bawasan ang paunang pagkaantala.

Sinusuportahan din ng artificial intelligence (AI) system ang pagsusuri ng dokumento at optical character recognition, na kumukuha ng teksto at istruktura mula sa mga ulat pinansyal, flowchart, at infographics.

Ayon sa QVAC, tinalo ng modelo ang mga kakompetensiyang may kaparehong laki ng average na 7.4% sa mga visual reasoning test. Nilampasan din nito ang mga modelong mahigit doble ang laki nito sa MM-IFEval at POPE, kabilang ang mga inilabas ng Qwen at InternVL.

Bakit Mahalaga ang Maliit na Footprint

Ang paglipat ng pagproseso ng imahe mula sa data center patungo sa telepono ay nagdadala ng mahihigpit na limitasyon sa memory, init, paggamit ng baterya, at computing power. Madalas nakakayanan ng mga compact na modelo ang simpleng teksto pero bumababa ang katumpakan kapag nagbabasa ng masisiksik na tsart, talahanayan, o mga na-scan na dokumento.

Ipinapahiwatig ng mga benchmark result ng QVAC na napanatili ng modelo ang malaking bahagi ng kakayahang iyon habang nananatiling sapat na maliit para sa mga consumer device. Ibig sabihin din ng local processing na hindi na kailangang i-upload ang mga dokumento, at makakapagpatuloy ang software kahit walang koneksyon sa network.

Binuo para sa Ilang Opsyon sa Deployment

Maaaring i-access ng mga developer ang modelo sa pamamagitan ng Hugging Face Transformers, isang quantized na GGUF na bersyon para sa llama.cpp, o isang vLLM backend para sa mas mataas na bolyum ng paggamit sa server.

Inilathala rin ng QVAC ang mga benchmark configuration nito sa pamamagitan ng VLMEvalKit, upang mapahintulutan ang mga panlabas na mananaliksik na ulitin ang mga pagsusulit. Parehong bersyon ay gumagamit ng Apache 2.0 na lisensya, na nagpapahintulot sa komersyal na paggamit, pagbabago, at muling pamamahagi.

Bahagi ng Mas Malawak na Estratehiya ng Tether sa AI

Sinabi ni Tether CEO Paolo Ardoino na sinusuportahan ng paglabas ang pagtulak ng kumpanya tungo sa mga lokal at episyenteng AI system.

“Ang pagkamit ng pinakamahusay sa klase na kalidad at performance sa mga pangkalahatang vision task sa 460 milyong parameter lamang ay nagpapatunay na ang local-first, lubos na episyenteng AI ay isang praktikal na landas,” sabi ni Ardoino.

Sumusunod ang modelo sa ilang QVAC release na nagsimula pa noong Oktubre 2025, kabilang ang mga synthetic training dataset, isang cross-platform software development kit, at mga medical model na idinisenyo para sa mga telepono at wearable device.

Para sa mga developer, nag-aalok ang paglabas ng offline na pagsusuri ng imahe nang walang API costs na nakabatay sa paggamit. Maaaring panatilihin ng mga negosyo ang mga sensitibong dokumento sa device, habang magagamit ng mga consumer ang mga AI feature kahit walang signal. Maaaring subukan ng mga mananaliksik nang independiyente ang mga pahayag ng kumpanya tungkol sa performance gamit ang mga inilathalang configuration.

Pinondohan ng Tether ang pagpapalawak nito sa AI gamit ang mga kita mula sa negosyo nitong USDT stablecoin. Namuhunan din ito sa AI infrastructure, biotechnology, at robotics, kabilang ang isang Series C investment sa NEURA Robotics na tinatayang may halaga na hanggang $1.4 bilyon.

Ang artikulong ito ay isinalin mula sa Ingles gamit ang AI. Ang orihinal na bersyon sa Ingles ang opisyal na pinagmumulan; maaaring maglaman ng mga kamalian ang mga awtomatikong pagsasalin, lalo na sa legal at regulatoryong terminolohiya.