مدل‌های هوش مصنوعی ایرانی — خانوادهٔ دیبا

دیبا (Diba) خانوادهٔ مدل‌های هوش مصنوعیِ فارسی‌محورِ دیباچین است — از مدلِ زبانیِ بزرگِ ایرانی تا امبدینگ، بینایی و گفتار — که با تمرکز بر زبان فارسی و شناختِ ایران ساخته شده‌اند، متن‌باز هستند و روی سخت‌افزارِ در دسترس اجرا می‌شوند.

دیباچین و خانوادهٔ دیبا

دیباچین (Dibachain) یک شرکتِ ایرانیِ هوش مصنوعی و توسعهٔ نرم‌افزار است که روی هوش مصنوعیِ فارسی‌محور تمرکز دارد. خروجیِ پژوهش و مهندسیِ دیباچین در قالبِ خانوادهٔ مدل‌های دیبا منتشر می‌شود؛ مجموعه‌ای هماهنگ از مدل‌ها که هر کدام یک وظیفهٔ مشخص را برعهده دارند اما مکملِ یکدیگرند و با هم یک پشتهٔ کاملِ هوش مصنوعیِ فارسی می‌سازند: از گفت‌وگو و کدنویسی تا جست‌وجوی معنایی، درکِ تصویر و تبدیلِ گفتار به متن.

آنچه دیبا را متمایز می‌کند، تمرکزِ عمیق بر فارسی و دانشِ ایران است — جایی که مدل‌های عمومیِ خارجی اغلب ضعیف عمل می‌کنند — در کنارِ متن‌باز بودن (مجوز Apache 2.0) و امکانِ اجرای آفلاین روی CPU که حریم خصوصی و استقلالِ داده را تضمین می‌کند. همهٔ مدل‌ها روی صفحهٔ سازمانِ دیباچین در Hugging Face در دسترس‌اند.

Diba-Base · دیبا

مدل زبانی بزرگ (تولید متن)

مدل زبانی بزرگِ ایرانی — گفت‌وگو و کدنویسیِ فارسی‌محور که آفلاین روی CPU اجرا می‌شود.

دیبا (Diba-Base) یک مدل زبانی بزرگ (LLM) ایرانی از دیباچین است؛ مدلی حدود ۴ میلیارد پارامتری و فارسی‌محور که ساخته شده تا در زبان فارسی عالی باشد، ایران را بشناسد (از جمله تاریخ معاصر)، و از روی دستورِ فارسی یا انگلیسی کد بنویسد. آفلاین روی CPU با GGUF اجرا می‌شود، به همان زبانی که می‌نویسید پاسخ می‌دهد و از فراخوانی ابزار (Tool Calling) پشتیبانی می‌کند. اگر دنبال یک مدل زبانی فارسی، یک چت‌بات هوش مصنوعی ایرانی، یا یک مدل زبان فارسیِ روی دستگاه هستید، دیبا همان است.

چه کاری انجام می‌دهد؟

  • فارسیِ درست: فارسیِ نوشتاریِ روان با رسم‌الخط و نیم‌فاصلهٔ درست؛ پاسخ به همان زبانِ پیامِ شما (فارسی ← فارسی، انگلیسی ← انگلیسی).
  • شناختِ ایران: جغرافیا، فرهنگ و تاریخ معاصر.
  • کدنویسی: پایتون، جاوااسکریپت، تایپ‌اسکریپت و زبان‌های دیگر، از روی دستورِ فارسی یا انگلیسی.
  • فراخوانی ابزار: تعریفِ توابع را می‌دهید و مدل تصمیم می‌گیرد کدام را با چه ورودی‌هایی صدا بزند.
  • اجرای آفلاین: یک فایل GGUF حدود ۲٫۸ گیگابایتی روی CPU؛ بدون ابر و بدون GPU.

Diba-Embed · دیبا-امبد

مدل بردارسازی متن (امبدینگ)

نخستین مدل امبدینگِ فارسی‌محورِ دیباچین برای جست‌وجوی معنایی و RAG فارسی.

دیبا-امبد (Diba-Embed) نخستین مدلِ بردارسازیِ متن (Text Embedding) شرکت دیباچین و اولین مدلِ امبدینگِ خانوادهٔ دیباست — مدلی فارسی‌محور که متنِ فارسی و انگلیسی را به بردارهای عددی تبدیل می‌کند تا متن‌های هم‌معنا در فضای برداری به هم نزدیک شوند. ویژهٔ کاربردهای فارسی‌زبان و ایرانی، جایی که بیشترِ مدل‌های متن‌باز ضعیف عمل می‌کنند. از آن برای جست‌وجوی معنایی، RAG، تطبیقِ پرسش‌های پرتکرار، خوشه‌بندی و بازچینشِ نتایج استفاده کنید.

چه کاری انجام می‌دهد؟

  • جست‌وجوی معناییِ فارسی: یافتنِ مرتبط‌ترین سند برای یک پرسشِ فارسی، حتی وقتی کلمه‌ها فرق دارند.
  • بازیابی برای RAG: یافتنِ بخش‌های درستِ اسنادِ شما تا پاسخِ یک مدلِ گفت‌وگو مانند دیبا بر پایهٔ همان اسناد ساخته شود.
  • تطبیقِ میان‌زبانی: یک پرسشِ فارسی می‌تواند سندِ انگلیسی را پیدا کند و برعکس.
  • خوشه‌بندی و حذفِ تکراری: گروه‌بندیِ تیکت‌ها، نظرها یا محصولاتِ مشابه و تشخیصِ موارد نزدیک.
  • بازچینش نتایج (Reranking): مرتب‌کردنِ بخش‌های نامزد بر اساسِ ارتباط با پرسش.

Diba-Vision · دیبا-ویژن

مدل بینایی-زبانی (تصویر + متن ← متن)

مدل بینایی-زبانیِ فارسی‌محور که عکس را می‌بیند و به فارسی پاسخ می‌دهد.

دیبا-ویژن (Diba-Vision) عکس را می‌بیند و به فارسی و انگلیسی پاسخ می‌دهد. این مدل، درکِ تصویریِ یک رمزگذارِ چندحالتهٔ قوی را با توانایی زبانِ فارسیِ خانوادهٔ دیبا ترکیب می‌کند؛ پس می‌تواند به یک عکس، سند یا اسکرین‌شات نگاه کند و روان دربارهٔ آن فارسی حرف بزند — جایی که بیشترِ مدل‌های بینایی متن‌باز ضعیف‌اند.

چه کاری انجام می‌دهد؟

  • توصیفِ تصویر به فارسی یا انگلیسیِ روان.
  • خواندنِ متنِ داخلِ تصویر: تابلوها، اسناد، فرم‌ها و متن‌های فارسی و انگلیسی (درکِ شبیه به OCR).
  • تحلیلِ اسکرین‌شات: صفحه‌های رابط کاربری، نمودار، جدول و اسکرین‌شاتِ کد.
  • پاسخ به پرسش دربارهٔ عکس: «اینجا چه خبر است؟»، «این تابلو چه نوشته؟»، «مشکلِ این رابط کاربری چیست؟».
  • استدلالِ هم‌زمان روی تصویر و متن در یک گفت‌وگو.

Diba-STT · دیبا-اس‌تی‌تی

تبدیل گفتار به متن (ASR)

تبدیل گفتار فارسی به متن — آفلاین، بلادرنگ و حتی داخلِ مرورگر.

دیبا-اس‌تی‌تی (Diba-STT) گفتارِ فارسی را به متن تبدیل می‌کند. کاملاً آفلاین اجرا می‌شود — روی CPU، روی گوشی، یا کاملاً داخلِ مرورگر — بدونِ ابر و بدونِ GPU، و بلادرنگ هم‌زمان با صحبتِ شما کار می‌کند. بخشی از خانوادهٔ مدل‌های دیبا ساختهٔ دیباچین.

چه کاری انجام می‌دهد؟

  • رونویسیِ بلادرنگ گفتار فارسی از میکروفون.
  • رونویسیِ آفلاین فایل‌های صوتیِ WAV (۱۶ کیلوهرتز، تک‌کاناله).
  • اجرای روی دستگاه — دسکتاپ، موبایل یا مرورگر — هیچ داده‌ای از دستگاه خارج نمی‌شود.

Platrix · پلاتریکس

تشخیص پلاک خودروی ایرانی (بینایی ماشین)

مدل‌های آمادهٔ ONNX برای تشخیص و خواندنِ پلاکِ خودروهای ایرانی، بلادرنگ و خودمیزبان.

پلاتریکس (Platrix) مجموعه مدل‌های تولیدیِ ONNX برای تشخیص و خواندنِ پلاکِ خودروهای ایرانی است که سامانهٔ بلادرنگ و خودمیزبانِ نظارتِ پلاکِ پلاتریکس را قدرت می‌دهد. خطِ لوله دومرحله‌ای است: یک تشخیص‌گرِ YOLO پلاک را در فریم پیدا می‌کند، سپس یک مرحلهٔ بهبودِ کیفیتِ تصویر آن را تمیز می‌کند، و در نهایت یک خوانندهٔ بدونِ بخش‌بندیِ CRNN + CTC کلِ پلاک را یک‌جا می‌خواند و چیدمانِ استانداردِ ایرانی را برمی‌گرداند. همهٔ مدل‌ها با ONNX Runtime اجرا می‌شوند — بدونِ نیاز به PyTorch یا TensorFlow هنگام اجرا.

چه کاری انجام می‌دهد؟

  • تشخیصِ پلاک در فریم: تشخیص‌گرِ اصلیِ YOLOv8 پلاک را پیدا می‌کند و یک تشخیص‌گرِ ثانویه فقط وقتی اجرا می‌شود که اولی چیزی نیابد.
  • بهبودِ کیفیتِ برشِ پلاک: بزرگ‌نمایی، حذفِ نویز، اصلاحِ کنتراست و تیزسازی — همان بهبود در آموزش هم اعمال شده تا ناسازگاریِ آموزش/اجرا نباشد.
  • خواندنِ کلِ پلاک یک‌جا: خوانندهٔ بدونِ بخش‌بندیِ CRNN+CTC که روی شکلِ واقعیِ نویسه‌های پلاکِ ایرانی آموزش دیده و نویسه‌های شبیه به هم را درست می‌خواند.
  • اجرای خودمیزبان و بلادرنگ: کلِ سامانه (داشبوردِ وب، استریمِ چنددوربینه، فهرستِ تحتِ نظر و API) در مخزنِ گیت‌هاب موجود است.

پرسش‌های متداول دربارهٔ خانوادهٔ دیبا

خانوادهٔ دیبا چیست؟

خانوادهٔ دیبا مجموعه‌ای از مدل‌های هوش مصنوعیِ فارسی‌محورِ شرکت دیباچین است: دیبا (مدل زبانی بزرگ)، دیبا-امبد (امبدینگ)، دیبا-ویژن (بینایی-زبانی) و دیبا-اس‌تی‌تی (گفتار به متن)، به‌همراه پلاتریکس برای تشخیص پلاک ایرانی.

آیا مدل‌های دیبا متن‌باز و رایگان‌اند؟

بله؛ مدل‌های خانوادهٔ دیبا با مجوز متن‌باز Apache 2.0 و پلاتریکس با مجوز MIT منتشر شده‌اند و روی Hugging Face در دسترس‌اند.

آیا می‌توان مدل‌های دیبا را آفلاین و روی CPU اجرا کرد؟

بله؛ دیبا و دیبا-امبد با فایل‌های GGUF روی CPU اجرا می‌شوند و دیبا-اس‌تی‌تی حتی داخلِ مرورگر کار می‌کند؛ همه بدون نیاز به GPU یا ابر.

مدل‌های دیبا را از کجا دریافت کنم؟

همهٔ مدل‌ها روی صفحهٔ سازمانِ دیباچین در Hugging Face (huggingface.co/Dibachain) منتشر شده‌اند و از همین صفحه به هر کدام لینک مستقیم داده‌ایم.