Tether Dataは、クラウドサーバーに依存せずスマートフォン上で直接動作するよう設計された、4億6000万パラメータのビジョン・言語モデルをオープンソース化しました。
テザー・データ、4億6000万パラメータの新型ビジョンモデルでAIをクラウドから切り離す

主なポイント:
- TetherのQVAC部門は、2026年7月29日に4億6000万パラメータのビジョンモデルをオープンソース化しました。
- このモデルは17のベンチマークテストのうち16で、Liquid AIやHugging Faceの競合モデルを上回りました。
- 「Flash」バージョンはiPhone 15上でSmolVLM2-500Mよりも最大36倍高速に動作しました。
同社のAI研究部門であるQVACが水曜日に公開した「VisionPsy-Nano」は、画像、文書、グラフを分析し、ソースデータをリモートシステムに送信することなく質問に回答できます。入力と応答の両方をスマートフォンが処理するため、ソフトウェアはオフラインで動作し、データを端末内に保持できます。
QVACによると、Tether AI Researchのモデルはパラメータ数が5億未満のビジョン・言語システムの中で最高の総合スコアを記録しました。17のベンチマークのうち16で競合モデルを上回りました。
性能比較
このモデルの正規化スコアは62.3を記録したのに対し、Liquid AIのLFM2.5-VL-450Mは59.6、Hugging FaceのSmolVLM2-500Mは52.5でした。 QVACの以前のベースモデルであるnanoVLM-460M-8kのスコアは54.9でした。Tether Dataのリリースには2つのバージョンがあります。標準ビルドは精度を優先し、Flashは応答速度を優先するために品質をわずかに犠牲にしています。 QVACによると、Flash版はフルモデルの性能を約99%維持しつつ、AndroidスマートフォンではSmolVLM2-500Mに比べて最大23倍、iPhone 15では最大36倍高速に最初の出力を生成できるという。この応答速度は、モバイル端末において重要な要素となる。 コンパクトなモデルはテストでは高いスコアを記録しても、デバイスが画像を処理している間、ユーザーが待たされるようでは実用的とは言えません。Flashは、その初期の遅延を軽減するように設計されています。 この人工知能(AI)システムは、文書分析や光学文字認識(OCR)にも対応しており、財務報告書、フローチャート、インフォグラフィックからテキストや構造を抽出します。
QVACによると、このモデルは視覚推論テストで同規模の競合モデルを平均7.4%上回り、MM-IFEvalやPOPEではQwenやInternVLのリリース版など、自身より2倍以上大きいモデルをも上回りました。
小さなフットプリントが重要な理由
画像処理をデータセンターからスマートフォンへ移すと、メモリ、発熱、バッテリー消費、演算能力に厳しい制約が生じます。コンパクトなモデルはプレーンテキストの処理には適していますが、複雑な図表や表、スキャンされた文書を読み取る際には精度が低下しがちです。
QVACのベンチマーク結果によると、このモデルはコンシューマー向けデバイスに搭載できるほど小型でありながら、多くの処理能力を維持していることが示唆されています。また、ローカル処理であるため文書をアップロードする必要がなく、ネットワーク接続がなくてもソフトウェアは動作し続けます。
複数の導入オプションに対応
開発者はHugging Face Transformers、llama.cpp用の量子化されたGGUFバージョン、あるいは大容量サーバー向けのvLLMバックエンドを通じて本モデルにアクセスできます。
また、QVACはVLMEvalKitを通じてベンチマーク構成を公開しており、外部の研究者もテストを再現できるようになっています。どちらのバージョンもApache 2.0ライセンスを採用しており、商用利用、改変、再配布が許可されています。
Tetherの広範なAI戦略の一環
TetherのCEOであるパオロ・アルドイノ氏は、今回のリリースが同社が推進するローカルで効率的なAIシステム開発を後押しすると述べました。アルドイノ氏は「わずか4億6000万パラメータで一般的な視覚タスクにおいてクラス最高の品質とパフォーマンスを達成したことは、ローカルファーストで高効率なAIが実現可能な道であることを証明しています」と語りました。
このモデルは2025年10月に遡る一連のQVACリリースに続くものであり、合成トレーニングデータセット、クロスプラットフォームのソフトウェア開発キット、スマートフォンやウェアラブルデバイス向けに設計された医療用モデルなどが含まれています。
開発者にとっては、今回のリリースにより、使用量に応じたAPIコストを伴わないオフライン画像分析が可能になります。企業は機密文書をデバイス上に保管でき、消費者は通信環境がなくてもAI機能を利用できます。研究者は公開された構成設定を用いて、同社の性能に関する主張を独自に検証できます。
Tetherは、USDTステーブルコイン事業で得た利益をAI事業拡大の資金に充てています。また、AIインフラやバイオテクノロジー、ロボティクス分野にも投資しており、その一環としてNEURA RoboticsへのシリーズC投資(最大14億ドル相当)も実施しています。
この記事はAIを使用して英語から翻訳されました。英語の原文が正式な情報源であり、自動翻訳には、特に法律および規制に関する用語において不正確な部分が含まれる場合があります。
















