Tether Data đã công bố mã nguồn mở cho một mô hình thị giác-ngôn ngữ có 460 triệu tham số, được phát triển để chạy trực tiếp trên điện thoại thông minh thay vì phải dựa vào các máy chủ đám mây.
Dữ liệu từ Tether đưa trí tuệ nhân tạo (AI) ra khỏi đám mây nhờ mô hình thị giác mới có 460 triệu tham số

Điểm chính
- Ngày 29 tháng 7 năm 2026, đơn vị QVAC của Tether đã công bố mã nguồn mở cho một mô hình thị giác có 460 triệu tham số.
- Mô hình này đã vượt qua các đối thủ như Liquid AI và Hugging Face trong 16 trên tổng số 17 bài kiểm tra chuẩn.
- Phiên bản Flash của mô hình này chạy nhanh hơn tới 36 lần so với SmolVLM2-500M trên iPhone 15.
Được công bố vào thứ Tư bởi bộ phận nghiên cứu AI của công ty, QVAC, VisionPsy-Nano có thể phân tích hình ảnh, tài liệu và biểu đồ, sau đó trả lời câu hỏi mà không cần gửi dữ liệu nguồn đến hệ thống từ xa. Điện thoại xử lý cả dữ liệu đầu vào và phản hồi, cho phép phần mềm hoạt động ngoại tuyến và lưu trữ dữ liệu trên thiết bị.
QVAC cho biết mô hình của Tether AI Research đã đạt điểm tổng thể cao nhất trong số các hệ thống thị giác-ngôn ngữ có dưới 500 triệu tham số. Trong 17 bài kiểm tra chuẩn, mô hình này đã đánh bại các mô hình cạnh tranh ở 16 bài.
So sánh hiệu suất
Mô hình này đạt điểm chuẩn hóa là 62,3, so với 59,6 của LFM2.5-VL-450M từ Liquid AI và 52,5 của SmolVLM2-500M từ Hugging Face. Mô hình cơ sở nanoVLM-460M-8k trước đó của QVAC đạt 54,9.
Phiên bản Tether Data được phát hành với hai biến thể. Phiên bản tiêu chuẩn ưu tiên độ chính xác, trong khi phiên bản Flash hy sinh một phần nhỏ chất lượng để có phản hồi nhanh hơn. QVAC cho biết phiên bản Flash vẫn duy trì khoảng 99% hiệu năng của mô hình đầy đủ, đồng thời tạo ra kết quả đầu tiên nhanh hơn tới 23 lần so với SmolVLM2-500M trên điện thoại Android và nhanh hơn tới 36 lần trên iPhone 15.
Thời gian phản hồi này rất quan trọng trên phần cứng di động. Một mô hình nhỏ gọn có thể đạt điểm cao trong các bài kiểm tra nhưng vẫn cảm thấy không thực tế nếu người dùng phải chờ đợi trong khi thiết bị xử lý hình ảnh. Phiên bản Flash được thiết kế để giảm thiểu độ trễ ban đầu đó.
Hệ thống trí tuệ nhân tạo (AI) này cũng hỗ trợ phân tích tài liệu và nhận dạng ký tự quang học (OCR), trích xuất văn bản và cấu trúc từ các báo cáo tài chính, sơ đồ luồng và đồ họa thông tin.
QVAC cho biết mô hình này đã vượt qua các đối thủ có kích thước tương tự với mức trung bình 7,4% trong các bài kiểm tra suy luận trực quan. Nó cũng vượt trội hơn các mô hình có kích thước gấp hơn hai lần so với nó trên MM-IFEval và POPE, bao gồm các phiên bản từ Qwen và InternVL.
Tại sao kích thước nhỏ lại quan trọng
Việc chuyển xử lý hình ảnh từ trung tâm dữ liệu sang điện thoại đặt ra những giới hạn nghiêm ngặt về bộ nhớ, nhiệt độ, mức tiêu thụ pin và sức mạnh tính toán. Các mô hình nhỏ gọn thường xử lý được văn bản thuần túy nhưng lại mất độ chính xác khi đọc các biểu đồ, bảng hoặc tài liệu quét có mật độ thông tin cao.
Kết quả điểm chuẩn của QVAC cho thấy mô hình này vẫn giữ được phần lớn khả năng đó trong khi vẫn đủ nhỏ gọn để sử dụng trên các thiết bị tiêu dùng. Xử lý cục bộ cũng có nghĩa là không cần tải lên tài liệu và phần mềm có thể tiếp tục hoạt động mà không cần kết nối mạng.
Được thiết kế cho nhiều tùy chọn triển khai
Các nhà phát triển có thể truy cập mô hình thông qua Hugging Face Transformers, phiên bản GGUF lượng tử hóa cho llama.cpp hoặc nền tảng vLLM dành cho việc sử dụng trên máy chủ có khối lượng lớn.
QVAC cũng đã công bố các cấu hình điểm chuẩn của mình thông qua VLMEvalKit, cho phép các nhà nghiên cứu bên ngoài lặp lại các thử nghiệm. Cả hai phiên bản đều sử dụng giấy phép Apache 2.0, cho phép sử dụng, sửa đổi và phân phối lại cho mục đích thương mại.
Một phần trong chiến lược AI tổng thể của Tether
Giám đốc điều hành (CEO) của Tether, Paolo Ardoino, cho biết việc ra mắt này hỗ trợ nỗ lực của công ty hướng tới các hệ thống AI cục bộ và hiệu quả.
“Việc đạt được chất lượng và hiệu suất hàng đầu trong các tác vụ thị giác chung chỉ với 460 triệu tham số chứng minh rằng AI ưu tiên cục bộ và cực kỳ hiệu quả là một con đường khả thi,” Ardoino nói.
Mô hình này tiếp nối một số bản phát hành QVAC từ tháng 10 năm 2025, bao gồm các bộ dữ liệu huấn luyện tổng hợp, bộ công cụ phát triển phần mềm đa nền tảng và các mô hình y tế được thiết kế cho điện thoại và thiết bị đeo.
Đối với các nhà phát triển, bản phát hành này cung cấp khả năng phân tích hình ảnh ngoại tuyến mà không phát sinh chi phí API dựa trên mức sử dụng. Các doanh nghiệp có thể lưu trữ tài liệu nhạy cảm trên thiết bị, trong khi người tiêu dùng có thể sử dụng các tính năng AI mà không cần kết nối mạng. Các nhà nghiên cứu có thể tự kiểm chứng các tuyên bố về hiệu suất của công ty thông qua các cấu hình đã được công bố.
Tether đã tài trợ cho việc mở rộng hoạt động AI bằng lợi nhuận từ mảng kinh doanh stablecoin USDT. Công ty cũng đã đầu tư vào cơ sở hạ tầng AI, công nghệ sinh học và robot, bao gồm khoản đầu tư Series C vào NEURA Robotics với giá trị lên tới 1,4 tỷ USD.
Bài viết này được dịch từ tiếng Anh bằng AI. Phiên bản gốc bằng tiếng Anh là nguồn có thẩm quyền; các bản dịch tự động có thể chứa thông tin không chính xác, đặc biệt là trong thuật ngữ pháp lý và quy định.
















