제공
Technology

테더 데이터, 4억 6천만 매개변수를 갖춘 새로운 비전 모델로 AI를 클라우드 밖으로 끌어내다

테더 데이터(Tether Data)는 클라우드 서버에 의존하지 않고 스마트폰에서 직접 실행되도록 설계된 4억 6천만 개의 매개변수를 가진 비전-언어 모델을 오픈소스로 공개했습니다.

작성자
공유
테더 데이터, 4억 6천만 매개변수를 갖춘 새로운 비전 모델로 AI를 클라우드 밖으로 끌어내다

주요 내용

  • 테더의 자회사인 QVAC은 2026년 7월 29일, 4억 6천만 매개변수를 가진 비전 모델을 오픈소스로 공개했습니다.
  • 이 모델은 17개 벤치마크 테스트 중 16개에서 리퀴드 AI(Liquid AI)와 허깅 페이스(Hugging Face)의 경쟁 모델들을 앞섰습니다.
  • 이 모델의 ‘Flash’ 버전은 아이폰 15에서 SmolVLM2-500M보다 최대 36배 더 빠르게 실행되었습니다.

수요일 테더의 AI 연구 부문인 QVAC이 공개한 ‘VisionPsy-Nano’는 이미지, 문서, 차트를 분석한 후 원본 자료를 원격 시스템으로 전송하지 않고도 질문에 답변할 수 있습니다. 스마트폰이 입력과 응답을 모두 처리하므로, 이 소프트웨어는 오프라인에서 작동하며 데이터를 기기 내에 보관할 수 있습니다.

QVAC에 따르면, Tether AI Research의 모델은 매개변수가 5억 미만인 비전-언어 시스템 중 가장 높은 종합 점수를 기록했다. 17개 벤치마크 중 16개에서 경쟁 모델들을 앞섰다.

경쟁 모델과의 비교

이 모델은 정규화 점수 62.3을 기록했으며, 이는 Liquid AI의 LFM2.5-VL-450M(59.6) 및 Hugging Face의 SmolVLM2-500M(52.5)보다 높은 수치입니다. QVAC의 이전 베이스 모델인 nanoVLM-460M-8k는 54.9점을 기록했습니다. Tether Data는 두 가지 버전으로 출시되었습니다. 표준 빌드는 정확도를 우선시하는 반면, Flash 버전은 응답 속도를 높이기 위해 정확도를 약간 희생합니다. QVAC에 따르면 Flash 버전은 전체 모델 성능의 약 99%를 유지하면서도 안드로이드 폰에서는 SmolVLM2-500M보다 최대 23배, 아이폰 15에서는 최대 36배 더 빠르게 첫 번째 출력 결과를 생성한다고 합니다. 이러한 응답 시간은 모바일 하드웨어에서 매우 중요합니다. 소형 모델은 테스트에서 좋은 점수를 받을 수 있지만, 기기가 이미지를 처리하는 동안 사용자가 기다려야 한다면 여전히 실용적이지 않게 느껴질 수 있습니다. Flash는 이러한 초기 지연 시간을 줄이기 위해 설계되었습니다. 이 인공지능(AI) 시스템은 문서 분석 및 광학 문자 인식(OCR)도 지원하여 재무 보고서, 플로우차트, 인포그래픽에서 텍스트와 구조를 추출합니다.

QVAC에 따르면, 이 모델은 시각적 추론 테스트에서 비슷한 규모의 경쟁 모델들을 평균 7.4% 차이로 앞섰습니다. 또한 MM-IFEval 및 POPE 평가에서 Qwen과 InternVL의 모델을 포함해 자체 크기보다 두 배 이상 큰 모델들보다도 우수한 성능을 보였습니다.

왜 작은 메모리 사용량이 중요한가

이미지 처리를 데이터 센터에서 스마트폰으로 옮기면 메모리, 발열, 배터리 사용량, 연산 능력에 엄격한 제약이 따릅니다. 소형 모델은 일반 텍스트는 잘 처리하지만, 복잡한 차트, 표 또는 스캔된 문서를 읽을 때는 정확도가 떨어지는 경우가 많습니다.

QVAC의 벤치마크 결과에 따르면, 이 모델은 소비자용 기기에 탑재할 수 있을 만큼 작은 크기를 유지하면서도 이러한 처리 능력을 상당 부분 보존한 것으로 나타났습니다. 또한 로컬 처리 방식 덕분에 문서를 업로드할 필요가 없으며, 네트워크 연결 없이도 소프트웨어가 계속 작동할 수 있습니다.

다양한 배포 옵션을 위해 설계됨

개발자는 Hugging Face Transformers, llama.cpp용 양자화된 GGUF 버전, 또는 대용량 서버 사용을 위한 vLLM 백엔드를 통해 이 모델에 접근할 수 있습니다.

QVAC는 또한 VLMEvalKit을 통해 벤치마크 구성을 공개하여 외부 연구자들이 테스트를 재현할 수 있도록 했습니다. 두 버전 모두 Apache 2.0 라이선스를 적용하여 상업적 사용, 수정 및 재배포가 허용됩니다.

Tether의 광범위한 AI 전략의 일환

Tether의 CEO 파올로 아르도이노(Paolo Ardoino)는 이번 출시가 로컬 기반의 효율적인 AI 시스템으로 나아가려는 회사의 노력을 뒷받침한다고 밝혔습니다. 아르도이노 CEO는 “단 4억 6천만 개의 파라미터로 일반 비전 과제에서 동급 최고의 품질과 성능을 달성한 것은 ‘로컬 우선’의 고효율 AI가 실현 가능한 길임을 증명한다”고 말했습니다.

이 모델은 2025년 10월로 거슬러 올라가는 여러 QVAC 출시물들을 잇는 것으로, 여기에는 합성 훈련 데이터셋, 크로스 플랫폼 소프트웨어 개발 키트(SDK), 그리고 스마트폰 및 웨어러블 기기를 위해 설계된 의료용 모델 등이 포함됩니다.

개발자들에게 이번 릴리스는 사용량 기반 API 비용 없이 오프라인 이미지 분석을 가능하게 합니다. 기업은 기기에 민감한 문서를 보관할 수 있고, 소비자는 신호가 없는 환경에서도 AI 기능을 사용할 수 있습니다. 연구자들은 공개된 구성을 활용해 회사의 성능 주장을 독립적으로 검증할 수 있습니다.

테더(Tether)는 USDT 스테이블코인 사업에서 발생한 수익으로 AI 사업 확장에 자금을 조달해 왔다. 또한 AI 인프라, 생명공학, 로봇 공학 분야에도 투자해 왔으며, 여기에는 최대 14억 달러 규모의 NEURA Robotics에 대한 시리즈 C 투자도 포함된다.

이 기사는 AI를 사용하여 영어에서 번역되었습니다. 영어 원본이 권위 있는 출처이며, 자동 번역에는 특히 법률 및 규제 용어에서 부정확한 내용이 포함될 수 있습니다.