ارائه توسط
Technology

داده‌های تتر با مدل جدید بیناییِ ۴۶۰ میلیونی پارامتر، هوش مصنوعی را از ابر خارج می‌کند

داده‌های تتر یک مدل بینایی-زبانی با ۴۶۰ میلیون پارامتر را متن‌باز کرده است که به‌جای تکیه بر سرورهای ابری، برای اجرا مستقیم روی گوشی‌های هوشمند ساخته شده است.

نویسنده
اشتراک
داده‌های تتر با مدل جدید بیناییِ ۴۶۰ میلیونی پارامتر، هوش مصنوعی را از ابر خارج می‌کند

نکات کلیدی

  • واحد QVAC تتر در تاریخ ۲۹ ژوئیه ۲۰۲۶ یک مدل بینایی با ۴۶۰ میلیون پارامتر را متن‌باز کرد.
  • این مدل در ۱۶ مورد از ۱۷ آزمون معیار، رقبای Liquid AI و Hugging Face را پشت سر گذاشت.
  • نسخه Flash آن روی آیفون ۱۵ تا ۳۶ برابر سریع‌تر از SmolVLM2-500M اجرا شد.

VisionPsy-Nano که روز چهارشنبه توسط بازوی پژوهش هوش مصنوعی شرکت، QVAC، منتشر شد، می‌تواند تصاویر، اسناد و نمودارها را بررسی کند و سپس بدون ارسال محتوای منبع به یک سامانه دوردست به پرسش‌ها پاسخ دهد. گوشی هم ورودی و هم پاسخ را مدیریت می‌کند و به نرم‌افزار اجازه می‌دهد آفلاین کار کند و داده‌ها را روی دستگاه نگه دارد.

QVAC می‌گوید مدل «پژوهش هوش مصنوعی تتر» بالاترین امتیاز کلی را در میان سامانه‌های بینایی-زبانی با کمتر از ۵۰۰ میلیون پارامتر ثبت کرده است. در ۱۷ بنچمارک، در ۱۶ مورد از مدل‌های رقیب بهتر عمل کرد.

در مقایسه با رقبا چگونه است

این مدل امتیاز نرمال‌شده ۶۲.۳ را ثبت کرد؛ در حالی که این عدد برای LFM2.5-VL-450M شرکت Liquid AI برابر با ۵۹.۶ و برای SmolVLM2-500M شرکت Hugging Face برابر با ۵۲.۵ بود. مدل پایه nanoVLM-460M-8k که پیش‌تر توسط QVAC ارائه شده بود، امتیاز ۵۴.۹ را کسب کرد.

انتشار داده‌های تتر در دو نسخه ارائه می‌شود. نسخه استاندارد دقت را در اولویت قرار می‌دهد، در حالی که Flash با صرف‌نظر از مقدار اندکی کیفیت، پاسخ‌های سریع‌تری ارائه می‌کند. QVAC می‌گوید Flash حدود ۹۹٪ از عملکرد مدل کامل را حفظ می‌کند و در عین حال نخستین خروجی خود را در گوشی‌های اندرویدی تا ۲۳ برابر سریع‌تر از SmolVLM2-500M و روی آیفون ۱۵ تا ۳۶ برابر سریع‌تر تولید می‌کند.

این زمان پاسخ‌گویی روی سخت‌افزار موبایل اهمیت دارد. یک مدل فشرده ممکن است در آزمون‌ها امتیاز خوبی بگیرد، اما اگر کاربران مجبور باشند هنگام پردازش یک تصویر منتظر بمانند، همچنان می‌تواند غیرعملی به نظر برسد. Flash برای کاهش این تأخیر اولیه طراحی شده است.

این سامانه هوش مصنوعی (AI) همچنین از تحلیل اسناد و تشخیص نوری نویسه‌ها (OCR) پشتیبانی می‌کند و متن و ساختار را از گزارش‌های مالی، فلوچارت‌ها و اینفوگرافیک‌ها استخراج می‌کند.

QVAC می‌گوید این مدل در آزمون‌های استدلال بصری، به‌طور میانگین ۷.۴٪ بهتر از رقبای هم‌اندازه عمل کرده است. همچنین در MM-IFEval و POPE از مدل‌هایی با بیش از دو برابر اندازه خود نیز بهتر عمل کرد؛ از جمله انتشارهایی از Qwen و InternVL.

چرا ردپای کوچک مهم است

انتقال پردازش تصویر از دیتاسنتر به گوشی، محدودیت‌های سخت‌گیرانه‌ای درباره حافظه، گرما، مصرف باتری و توان محاسباتی ایجاد می‌کند. مدل‌های فشرده اغلب متن ساده را خوب مدیریت می‌کنند، اما هنگام خواندن نمودارهای متراکم، جدول‌ها یا اسناد اسکن‌شده دقتشان کاهش می‌یابد.

نتایج بنچمارک QVAC نشان می‌دهد این مدل بخش زیادی از آن توانمندی را حفظ کرده و در عین حال به اندازه کافی کوچک مانده تا برای دستگاه‌های مصرف‌کننده مناسب باشد. پردازش محلی همچنین یعنی اسناد نیازی به آپلود ندارند و نرم‌افزار می‌تواند بدون اتصال شبکه هم به کار ادامه دهد.

ساخته‌شده برای چندین گزینه استقرار

توسعه‌دهندگان می‌توانند از طریق Hugging Face Transformers به مدل دسترسی داشته باشند، یا از نسخه کمّی‌سازی‌شده GGUF برای llama.cpp استفاده کنند، یا برای استفاده سروری با حجم بالاتر از یک بک‌اند vLLM بهره ببرند.

QVAC همچنین پیکربندی‌های بنچمارک خود را از طریق VLMEvalKit منتشر کرده است تا پژوهشگران بیرونی بتوانند آزمون‌ها را تکرار کنند. هر دو نسخه تحت مجوز Apache 2.0 هستند که استفاده تجاری، اصلاح و توزیع مجدد را مجاز می‌کند.

بخشی از راهبرد گسترده‌تر هوش مصنوعی تتر

پائولو آردوینو، مدیرعامل تتر گفت این انتشار از تلاش شرکت برای حرکت به سمت سامانه‌های هوش مصنوعی محلی و کارآمد پشتیبانی می‌کند.

آردوینو گفت: «دستیابی به کیفیت و عملکردِ برترِ کلاس در وظایف عمومی بینایی با تنها ۴۶۰ میلیون پارامتر نشان می‌دهد که رویکردِ محلی‌محور و هوش مصنوعیِ بسیار کارآمد یک مسیر عملی است.»

این مدل در ادامه چندین انتشار QVAC از اکتبر ۲۰۲۵ ارائه شده است؛ از جمله مجموعه‌داده‌های آموزشی مصنوعی، یک کیت توسعه نرم‌افزار چندسکویی، و مدل‌های پزشکی طراحی‌شده برای گوشی‌ها و دستگاه‌های پوشیدنی.

برای توسعه‌دهندگان، این انتشار تحلیل آفلاین تصویر را بدون هزینه‌های API مبتنی بر میزان استفاده ارائه می‌کند. کسب‌وکارها می‌توانند اسناد حساس را روی دستگاه نگه دارند، در حالی که مصرف‌کنندگان می‌توانند بدون آنتن هم از قابلیت‌های هوش مصنوعی استفاده کنند. پژوهشگران نیز می‌توانند با استفاده از پیکربندی‌های منتشرشده، ادعاهای عملکردی شرکت را به‌طور مستقل آزمایش کنند.

تتر توسعه هوش مصنوعی خود را تأمین مالی کرده است با سودهای حاصل از کسب‌وکار استیبل‌کوین USDT خود. همچنین در زیرساخت هوش مصنوعی، زیست‌فناوری و رباتیک سرمایه‌گذاری کرده است؛ از جمله سرمایه‌گذاری سری C در NEURA Robotics که ارزش آن تا ۱.۴ میلیارد دلار برآورد شده است.

این مقاله با استفاده از هوش مصنوعی از انگلیسی ترجمه شده است. نسخه اصلی انگلیسی منبع معتبر است؛ ترجمه‌های خودکار ممکن است حاوی نادرستی‌هایی باشند، به‌ویژه در اصطلاحات حقوقی و قانونی.

برچسب‌ها در این داستان