دیبا-ویژن (Diba-Vision) عکس را میبیند و به فارسی و انگلیسی پاسخ میدهد. این مدل، درکِ تصویریِ یک رمزگذارِ چندحالتهٔ قوی را با توانایی زبانِ فارسیِ خانوادهٔ دیبا ترکیب میکند؛ پس میتواند به یک عکس، سند یا اسکرینشات نگاه کند و روان دربارهٔ آن فارسی حرف بزند — جایی که بیشترِ مدلهای بینایی متنباز ضعیفاند.
چه کارهایی انجام میدهد
- توصیفِ تصویر به فارسی یا انگلیسیِ روان.
- خواندنِ متنِ داخلِ تصویر: تابلوها، اسناد، فرمها و متنهای فارسی و انگلیسی (درکِ شبیه به OCR).
- تحلیلِ اسکرینشات: صفحههای رابط کاربری، نمودار، جدول و اسکرینشاتِ کد.
- پاسخ به پرسش دربارهٔ عکس: «اینجا چه خبر است؟»، «این تابلو چه نوشته؟»، «مشکلِ این رابط کاربری چیست؟».
- استدلالِ همزمان روی تصویر و متن در یک گفتوگو.
مشخصات فنی
| نوع | مدل بینایی-زبانی (تصویر + متن ← متن) |
|---|---|
| تعداد پارامتر | حدود ۴ میلیارد |
| ورودی | یک یا چند تصویر همراه با پرسشِ متنی (گفتوگوی چندمرحلهای) |
| خروجی | متن، به همان زبانِ پرسشِ شما |
| زبانها | فارسیمحور، بههمراه انگلیسی |
| مجوز | Apache 2.0 (متنباز) |
شروع سریع
from transformers import AutoModelForImageTextToText, AutoProcessor
import torch
model = AutoModelForImageTextToText.from_pretrained(
"Dibachain/Diba-Vision", trust_remote_code=True, dtype=torch.bfloat16, device_map="auto")
processor = AutoProcessor.from_pretrained("Dibachain/Diba-Vision", trust_remote_code=True)
messages = [{"role": "user", "content": [
{"type": "image", "image": "path/or/url/to/image.jpg"},
{"type": "text", "text": "این تصویر را به فارسی توضیح بده."},
]}]
inputs = processor.apply_chat_template(messages, add_generation_prompt=True,
tokenize=True, return_dict=True, return_tensors="pt").to(model.device)
out = model.generate(**inputs, max_new_tokens=512)
print(processor.batch_decode(out[:, inputs["input_ids"].shape[1]:], skip_special_tokens=True)[0])
راهنمای کامل، فایلهای GGUF/ONNX و نمونههای بیشتر در کارتِ مدل روی Hugging Face در دسترس است.
دموها و نمایشِ زنده
کاربرد و محدودیتها
دیبا-ویژن برای درکِ تصویر و پاسخ دربارهٔ آن است، نه برای تولیدِ تصویر. بهترین کیفیت روی عکسهای روزمره، اسناد و صفحههاست؛ متنهای بسیار ریز، اسکنهای بیکیفیت یا نمودارهای خیلی تخصصی ممکن است اشتباه خوانده شوند. برای گفتوگوی متنی و کد از دیبا (Diba-Base) استفاده کنید.
پرسشهای متداول
دیبا-ویژن چه کاری انجام میدهد؟
تصویر را میبیند و به فارسی و انگلیسی دربارهاش پاسخ میدهد: توصیف تصویر، خواندن متن داخل تصویر (شبیه OCR)، تحلیل اسکرینشات و پاسخ به پرسش دربارهٔ عکس.
آیا دیبا-ویژن متن فارسیِ داخلِ تصویر را میخواند؟
بله؛ میتواند تابلوها، اسناد و فرمهای فارسی و انگلیسی را با درکی شبیه OCR بخواند، هرچند متنهای بسیار ریز یا اسکنهای بیکیفیت ممکن است اشتباه خوانده شوند.
آیا دیبا-ویژن تصویر تولید میکند؟
خیر؛ این مدل برای درکِ تصویر و پاسخ دربارهٔ آن است، نه تولیدِ تصویر.