دادههای تتر یک مدل بینایی-زبانی با ۴۶۰ میلیون پارامتر را متنباز کرده است که بهجای تکیه بر سرورهای ابری، برای اجرا مستقیم روی گوشیهای هوشمند ساخته شده است.
دادههای تتر با مدل جدید بیناییِ ۴۶۰ میلیونی پارامتر، هوش مصنوعی را از ابر خارج میکند

نکات کلیدی
- واحد QVAC تتر در تاریخ ۲۹ ژوئیه ۲۰۲۶ یک مدل بینایی با ۴۶۰ میلیون پارامتر را متنباز کرد.
- این مدل در ۱۶ مورد از ۱۷ آزمون معیار، رقبای Liquid AI و Hugging Face را پشت سر گذاشت.
- نسخه Flash آن روی آیفون ۱۵ تا ۳۶ برابر سریعتر از SmolVLM2-500M اجرا شد.
VisionPsy-Nano که روز چهارشنبه توسط بازوی پژوهش هوش مصنوعی شرکت، QVAC، منتشر شد، میتواند تصاویر، اسناد و نمودارها را بررسی کند و سپس بدون ارسال محتوای منبع به یک سامانه دوردست به پرسشها پاسخ دهد. گوشی هم ورودی و هم پاسخ را مدیریت میکند و به نرمافزار اجازه میدهد آفلاین کار کند و دادهها را روی دستگاه نگه دارد.
QVAC میگوید مدل «پژوهش هوش مصنوعی تتر» بالاترین امتیاز کلی را در میان سامانههای بینایی-زبانی با کمتر از ۵۰۰ میلیون پارامتر ثبت کرده است. در ۱۷ بنچمارک، در ۱۶ مورد از مدلهای رقیب بهتر عمل کرد.
در مقایسه با رقبا چگونه است
این مدل امتیاز نرمالشده ۶۲.۳ را ثبت کرد؛ در حالی که این عدد برای LFM2.5-VL-450M شرکت Liquid AI برابر با ۵۹.۶ و برای SmolVLM2-500M شرکت Hugging Face برابر با ۵۲.۵ بود. مدل پایه nanoVLM-460M-8k که پیشتر توسط QVAC ارائه شده بود، امتیاز ۵۴.۹ را کسب کرد.
انتشار دادههای تتر در دو نسخه ارائه میشود. نسخه استاندارد دقت را در اولویت قرار میدهد، در حالی که Flash با صرفنظر از مقدار اندکی کیفیت، پاسخهای سریعتری ارائه میکند. QVAC میگوید Flash حدود ۹۹٪ از عملکرد مدل کامل را حفظ میکند و در عین حال نخستین خروجی خود را در گوشیهای اندرویدی تا ۲۳ برابر سریعتر از SmolVLM2-500M و روی آیفون ۱۵ تا ۳۶ برابر سریعتر تولید میکند.
این زمان پاسخگویی روی سختافزار موبایل اهمیت دارد. یک مدل فشرده ممکن است در آزمونها امتیاز خوبی بگیرد، اما اگر کاربران مجبور باشند هنگام پردازش یک تصویر منتظر بمانند، همچنان میتواند غیرعملی به نظر برسد. Flash برای کاهش این تأخیر اولیه طراحی شده است.
این سامانه هوش مصنوعی (AI) همچنین از تحلیل اسناد و تشخیص نوری نویسهها (OCR) پشتیبانی میکند و متن و ساختار را از گزارشهای مالی، فلوچارتها و اینفوگرافیکها استخراج میکند.
QVAC میگوید این مدل در آزمونهای استدلال بصری، بهطور میانگین ۷.۴٪ بهتر از رقبای هماندازه عمل کرده است. همچنین در MM-IFEval و POPE از مدلهایی با بیش از دو برابر اندازه خود نیز بهتر عمل کرد؛ از جمله انتشارهایی از Qwen و InternVL.
چرا ردپای کوچک مهم است
انتقال پردازش تصویر از دیتاسنتر به گوشی، محدودیتهای سختگیرانهای درباره حافظه، گرما، مصرف باتری و توان محاسباتی ایجاد میکند. مدلهای فشرده اغلب متن ساده را خوب مدیریت میکنند، اما هنگام خواندن نمودارهای متراکم، جدولها یا اسناد اسکنشده دقتشان کاهش مییابد.
نتایج بنچمارک QVAC نشان میدهد این مدل بخش زیادی از آن توانمندی را حفظ کرده و در عین حال به اندازه کافی کوچک مانده تا برای دستگاههای مصرفکننده مناسب باشد. پردازش محلی همچنین یعنی اسناد نیازی به آپلود ندارند و نرمافزار میتواند بدون اتصال شبکه هم به کار ادامه دهد.
ساختهشده برای چندین گزینه استقرار
توسعهدهندگان میتوانند از طریق Hugging Face Transformers به مدل دسترسی داشته باشند، یا از نسخه کمّیسازیشده GGUF برای llama.cpp استفاده کنند، یا برای استفاده سروری با حجم بالاتر از یک بکاند vLLM بهره ببرند.
QVAC همچنین پیکربندیهای بنچمارک خود را از طریق VLMEvalKit منتشر کرده است تا پژوهشگران بیرونی بتوانند آزمونها را تکرار کنند. هر دو نسخه تحت مجوز Apache 2.0 هستند که استفاده تجاری، اصلاح و توزیع مجدد را مجاز میکند.
بخشی از راهبرد گستردهتر هوش مصنوعی تتر
پائولو آردوینو، مدیرعامل تتر گفت این انتشار از تلاش شرکت برای حرکت به سمت سامانههای هوش مصنوعی محلی و کارآمد پشتیبانی میکند.
آردوینو گفت: «دستیابی به کیفیت و عملکردِ برترِ کلاس در وظایف عمومی بینایی با تنها ۴۶۰ میلیون پارامتر نشان میدهد که رویکردِ محلیمحور و هوش مصنوعیِ بسیار کارآمد یک مسیر عملی است.»
این مدل در ادامه چندین انتشار QVAC از اکتبر ۲۰۲۵ ارائه شده است؛ از جمله مجموعهدادههای آموزشی مصنوعی، یک کیت توسعه نرمافزار چندسکویی، و مدلهای پزشکی طراحیشده برای گوشیها و دستگاههای پوشیدنی.
برای توسعهدهندگان، این انتشار تحلیل آفلاین تصویر را بدون هزینههای API مبتنی بر میزان استفاده ارائه میکند. کسبوکارها میتوانند اسناد حساس را روی دستگاه نگه دارند، در حالی که مصرفکنندگان میتوانند بدون آنتن هم از قابلیتهای هوش مصنوعی استفاده کنند. پژوهشگران نیز میتوانند با استفاده از پیکربندیهای منتشرشده، ادعاهای عملکردی شرکت را بهطور مستقل آزمایش کنند.
تتر توسعه هوش مصنوعی خود را تأمین مالی کرده است با سودهای حاصل از کسبوکار استیبلکوین USDT خود. همچنین در زیرساخت هوش مصنوعی، زیستفناوری و رباتیک سرمایهگذاری کرده است؛ از جمله سرمایهگذاری سری C در NEURA Robotics که ارزش آن تا ۱.۴ میلیارد دلار برآورد شده است.
این مقاله با استفاده از هوش مصنوعی از انگلیسی ترجمه شده است. نسخه اصلی انگلیسی منبع معتبر است؛ ترجمههای خودکار ممکن است حاوی نادرستیهایی باشند، بهویژه در اصطلاحات حقوقی و قانونی.
















