Diba-Vision · دیبا-ویژن

مدل بینایی-زبانیِ فارسی‌محور که عکس را می‌بیند و به فارسی پاسخ می‌دهد.

دیبا مدل بینایی-زبانی (تصویر + متن ← متن) 🤗 Hugging Face ▶ دموی زنده

دیبا-ویژن (Diba-Vision) عکس را می‌بیند و به فارسی و انگلیسی پاسخ می‌دهد. این مدل، درکِ تصویریِ یک رمزگذارِ چندحالتهٔ قوی را با توانایی زبانِ فارسیِ خانوادهٔ دیبا ترکیب می‌کند؛ پس می‌تواند به یک عکس، سند یا اسکرین‌شات نگاه کند و روان دربارهٔ آن فارسی حرف بزند — جایی که بیشترِ مدل‌های بینایی متن‌باز ضعیف‌اند.

چه کارهایی انجام می‌دهد

  • توصیفِ تصویر به فارسی یا انگلیسیِ روان.
  • خواندنِ متنِ داخلِ تصویر: تابلوها، اسناد، فرم‌ها و متن‌های فارسی و انگلیسی (درکِ شبیه به OCR).
  • تحلیلِ اسکرین‌شات: صفحه‌های رابط کاربری، نمودار، جدول و اسکرین‌شاتِ کد.
  • پاسخ به پرسش دربارهٔ عکس: «اینجا چه خبر است؟»، «این تابلو چه نوشته؟»، «مشکلِ این رابط کاربری چیست؟».
  • استدلالِ هم‌زمان روی تصویر و متن در یک گفت‌وگو.

مشخصات فنی

نوعمدل بینایی-زبانی (تصویر + متن ← متن)
تعداد پارامترحدود ۴ میلیارد
ورودییک یا چند تصویر همراه با پرسشِ متنی (گفت‌وگوی چندمرحله‌ای)
خروجیمتن، به همان زبانِ پرسشِ شما
زبان‌هافارسی‌محور، به‌همراه انگلیسی
مجوزApache 2.0 (متن‌باز)

شروع سریع

Transformers (پایتون)
from transformers import AutoModelForImageTextToText, AutoProcessor
import torch

model = AutoModelForImageTextToText.from_pretrained(
    "Dibachain/Diba-Vision", trust_remote_code=True, dtype=torch.bfloat16, device_map="auto")
processor = AutoProcessor.from_pretrained("Dibachain/Diba-Vision", trust_remote_code=True)

messages = [{"role": "user", "content": [
    {"type": "image", "image": "path/or/url/to/image.jpg"},
    {"type": "text", "text": "این تصویر را به فارسی توضیح بده."},
]}]

inputs = processor.apply_chat_template(messages, add_generation_prompt=True,
    tokenize=True, return_dict=True, return_tensors="pt").to(model.device)
out = model.generate(**inputs, max_new_tokens=512)
print(processor.batch_decode(out[:, inputs["input_ids"].shape[1]:], skip_special_tokens=True)[0])

راهنمای کامل، فایل‌های GGUF/ONNX و نمونه‌های بیشتر در کارتِ مدل روی Hugging Face در دسترس است.

دموها و نمایشِ زنده

کاربرد و محدودیت‌ها

دیبا-ویژن برای درکِ تصویر و پاسخ دربارهٔ آن است، نه برای تولیدِ تصویر. بهترین کیفیت روی عکس‌های روزمره، اسناد و صفحه‌هاست؛ متن‌های بسیار ریز، اسکن‌های بی‌کیفیت یا نمودارهای خیلی تخصصی ممکن است اشتباه خوانده شوند. برای گفت‌وگوی متنی و کد از دیبا (Diba-Base) استفاده کنید.

پرسش‌های متداول

دیبا-ویژن چه کاری انجام می‌دهد؟

تصویر را می‌بیند و به فارسی و انگلیسی درباره‌اش پاسخ می‌دهد: توصیف تصویر، خواندن متن داخل تصویر (شبیه OCR)، تحلیل اسکرین‌شات و پاسخ به پرسش دربارهٔ عکس.

آیا دیبا-ویژن متن فارسیِ داخلِ تصویر را می‌خواند؟

بله؛ می‌تواند تابلوها، اسناد و فرم‌های فارسی و انگلیسی را با درکی شبیه OCR بخواند، هرچند متن‌های بسیار ریز یا اسکن‌های بی‌کیفیت ممکن است اشتباه خوانده شوند.

آیا دیبا-ویژن تصویر تولید می‌کند؟

خیر؛ این مدل برای درکِ تصویر و پاسخ دربارهٔ آن است، نه تولیدِ تصویر.