技术支持
Technology

Tether Data 推出全新 4.6 亿参数视觉模型,将人工智能从云端解放出来

Tether Data 开源了一个拥有 4.6 亿个参数的视觉-语言模型,该模型专为直接在智能手机上运行而设计,无需依赖云服务器。

分享
Tether Data 推出全新 4.6 亿参数视觉模型,将人工智能从云端解放出来

要点:

  • Tether旗下的QVAC部门于2026年7月29日开源了一个拥有4.6亿参数的视觉模型。
  • 该模型在17项基准测试中的16项中,表现均优于Liquid AI和Hugging Face的竞品。
  • 其Flash版本在iPhone 15上的运行速度最高可达SmolVLM2-500M的36倍。

由该公司AI研究部门QVAC于周三发布的VisionPsy-Nano能够分析图像、文档和图表,并在无需将源材料发送至远程系统的情况下回答问题。手机同时处理输入和响应,使该软件能够离线运行并将数据保存在设备上。

QVAC表示,Tether AI Research的该模型在参数数少于5亿的视觉-语言系统中取得了最高综合得分。在17项基准测试中,它在16项上击败了竞争对手模型。

性能对比

该模型的标准化得分为62.3,而Liquid AI的LFM2.5-VL-450M得分为59.6,Hugging Face的SmolVLM2-500M得分为52.5。 QVAC此前发布的nanoVLM-460M-8k基础模型得分为54.9。Tether Data此次发布的版本分为两个版本。标准版侧重准确性,而Flash版则在牺牲少量质量的前提下换取更快的响应速度。 QVAC表示,Flash版本在保留完整模型约99%性能的同时,其首次输出速度在安卓手机上比SmolVLM2-500M快达23倍,在iPhone 15上快达36倍。在移动设备上,响应时间至关重要。 紧凑型模型在测试中可能表现优异,但如果用户必须等待设备处理图像,仍会觉得不实用。Flash 正是为了减少这种初始延迟而设计的。 该人工智能(AI)系统还支持文档分析和光学字符识别,能够从财务报告、流程图和信息图中提取文本和结构。

QVAC表示,在视觉推理测试中,该模型平均比同等规模的竞争对手高出7.4%。在MM-IFEval和POPE评估集上,其表现也优于规模超过其两倍的模型,包括Qwen和InternVL发布的模型。

为何小体积至关重要

将图像处理从数据中心转移到手机上,会对内存、发热、电池消耗和计算能力带来严格的限制。紧凑型模型通常能处理纯文本,但在读取密集的图表、表格或扫描文档时会失去准确性。

QVAC的基准测试结果表明,该模型在保持足够小巧以适配消费级设备的同时,仍保留了大部分处理能力。本地处理还意味着无需上传文档,且软件可在无网络连接的情况下继续运行。

支持多种部署方案

开发者可通过 Hugging Face Transformers、适用于 llama.cpp 的量化 GGUF 版本,或面向高吞吐量服务器使用的 vLLM 后端访问该模型。

QVAC还通过VLMEvalKit发布了其基准测试配置,以便外部研究人员能够复现这些测试。这两个版本均采用Apache 2.0许可证,允许商业使用、修改和再分发。

Tether更广泛AI战略的一部分

Tether首席执行官Paolo Ardoino表示,此次发布支持了公司推动本地化、高效AI系统的战略。 “仅凭4.6亿个参数就在通用视觉任务上实现业界领先的质量和性能,证明了‘本地优先、高效AI’是一条可行的路径,”Ardoino说道。

该模型是继2025年10月以来QVAC系列发布后的又一成果,此前发布的包括合成训练数据集、跨平台软件开发工具包,以及专为手机和可穿戴设备设计的医疗模型。

对于开发者而言,此次发布提供了无需按使用量付费的API成本的离线图像分析功能。企业可将敏感文档保存在设备上,而消费者则可在无信号的情况下使用AI功能。研究人员可利用已发布的配置,独立验证该公司关于性能的声明。

Tether利用其USDT稳定币业务的利润为AI业务扩张提供了资金支持。该公司还投资了AI基础设施、生物技术和机器人技术领域,其中包括对NEURA Robotics高达14亿美元的C轮投资。

本文由人工智能从英文翻译而来。英文原版为权威来源;自动翻译可能存在不准确之处,尤其是在法律和监管术语方面。