در حال بارگذاری 0%
// منو.exe
خانه رزومه بلاگ تماس سفارش
English فارسی
~/blog / technology / ai-model-naming

درک نام مدل‌های هوش مصنوعی: رمزگشایی از زبان فنی LLMها

وقتی وارد صفحه دانلود یک مدل می‌شوید و چیزی مثل Qwen3-30B-A3B-Instruct-2507-GGUF-Q4_K_M می‌بینید، ممکن است بیشتر شبیه یک رمز عبور به نظر برسد تا نام یک نرم‌افزار. اما هر بخش از این نام چیزی مهم درباره مدل به شما می‌گوید.

# یک مدل هوش مصنوعی از چه چیزی ساخته شده است؟

قبل از اینکه سراغ نام مدل‌ها برویم، باید یک مفهوم اساسی را بشناسیم: پارامتر. اگر بخواهیم خیلی ساده نگاه کنیم، یک مدل زبانی بزرگ مجموعه عظیمی از اعداد است که در فرایند آموزش تغییر کرده‌اند. مدل با دیدن حجم زیادی از داده، این پارامترها را طوری تنظیم می‌کند که بتواند الگوهای زبان، کد، منطق و اطلاعات موجود در داده‌های آموزشی را یاد بگیرد.
نکته کلیدی: وقتی اعدادی مثل 7B، 14B یا 32B کنار نام یک مدل می‌بینید، معمولاً به تعداد پارامترهای آن اشاره دارند.

# 7B، 14B و 32B یعنی چه؟

حرف B مخفف Billion یا میلیارد است. بنابراین:
7B
≈ ۷ میلیارد پارامتر
14B
≈ ۱۴ میلیارد پارامتر
32B
≈ ۳۲ میلیارد پارامتر
70B
≈ ۷۰ میلیارد پارامتر
برای مثال، وقتی Llama-3.1-8B را می‌بینید، 8B یعنی این مدل در حدود ۸ میلیارد پارامتر دارد.
اشتباه رایج: پارامتر بیشتر الزاماً به معنی مدل بهتر نیست. مدل 32B لزوماً در همه کارها بهتر از مدل 14B نیست. معماری مدل، کیفیت داده‌های آموزشی، روش آموزش و تنظیمات پساآموزش همگی اهمیت دارند.

# A3B چیست؟

اینجا اسم مدل‌ها کمی عجیب‌تر می‌شود. مثلاً Qwen3-30B-A3B-Instruct-2507. قسمت 30B-A3B یک نکته بسیار مهم درباره معماری مدل را نشان می‌دهد. این یک مدل Mixture of Experts یا MoE است که در مجموع حدود 30.5 میلیارد پارامتر دارد، اما حدود 3.3 میلیارد پارامتر آن در هر Token فعال می‌شود.
ایده این است که مدل مجبور نیست برای پردازش هر Token از تمام متخصص‌های خود استفاده کند. یک Router انتخاب می‌کند چه متخصص‌هایی برای آن ورودی مناسب‌ترند.
1
سؤال — ورودی دریافت می‌شود
2
Router — تصمیم می‌گیرد کدام Expertها استفاده شوند
3
انتخاب Expertها — ۸ مورد از ۱۲۸ مورد
4
پردازش — فقط ≈ ۳.۳ میلیارد پارامتر فعال
5
پاسخ — خروجی تولید می‌شود
نکته مهم: A3B به این معنی نیست که این مدل از نظر حافظه دقیقاً مثل یک مدل 3B است. پارامترهای کل مدل همچنان باید برای Expertهای مختلف در دسترس باشند. 30B-A3B3B.

# Dense و MoE چه فرقی دارند؟

در یک مدل Dense، محاسبات هر Token به‌صورت متراکم در کل شبکه انجام می‌شود. اما در MoE، فقط بخشی از Expertها برای هر Token انتخاب می‌شوند. این معماری به سازندگان مدل اجازه می‌دهد ظرفیت پارامتری بسیار بزرگی داشته باشند، بدون اینکه هزینه محاسبات هر Token دقیقاً به اندازه فعال‌سازی تمام پارامترهای مدل باشد.
مدل Dense

تمام پارامترها برای هر Token فعال

  • ورودی → تمام بخش‌های مدل → خروجی
  • محاسبه کامل برای هر Token
  • معماری ساده‌تر
مدل MoE

فقط Expertهای انتخاب‌شده فعال می‌شوند

  • ورودی → Router → Expertهای انتخاب‌شده → خروجی
  • محاسبه جزئی برای هر Token
  • ظرفیت بزرگ، هزینه محاسبات کمتر

# Instruct یعنی چه؟

یکی از پرتکرارترین کلماتی که در اسم مدل‌ها می‌بینیم Instruct است. Instruct به مدل‌هایی اشاره می‌کند که برای دنبال کردن دستورهای کاربر تنظیم شده‌اند. مدل پایه بیشتر برای پیش‌بینی و ادامه متن آموزش دیده، اما در مدل Instruction-Tuned، مدل برای تعامل با دستورها آماده شده است:
خلاصه‌سازی
  • "این متن را خلاصه کن"
کدنویسی
  • "این کد را اصلاح کن"
ترجمه
  • "این متن را به فارسی ترجمه کن"
ایجاد
  • "یک تابع PHP بنویس"
1
مدل پایه — آموزش روی داده خام
2
Instruction Tuning — یادگیری دنبال کردن دستور
3
مدل Instruct — آماده برای استفاده روزمره
به همین دلیل اگر هدف شما استفاده روزمره، گفت‌وگو یا اجرای دستور است، معمولاً نسخه Instruct انتخاب مناسب‌تری است.

# Base یعنی چه؟

در مقابل Instruct ممکن است با Base مواجه شوید. Base یعنی مدل پایه — نقطه شروع برای توسعه، Fine-tuning یا کاربردهای خاص.
Base

نقطه شروع برای توسعه

  • پیش‌بینی و ادامه متن
  • برای Fine-tuning و تحقیق
Instruct

آماده برای تعامل با کاربر

  • دنبال کردن دستورها
  • بهینه برای گفت‌وگو

# Coder یعنی چه؟

مدل‌هایی با نام Coder معمولاً برای کارهای برنامه‌نویسی هدف‌گذاری یا تنظیم شده‌اند. برای مثال خانواده‌هایی مثل Qwen-Coder یا DeepSeek-Coder. اگر هدف اصلی شما برنامه‌نویسی است، یک مدل Coder می‌تواند انتخاب منطقی‌تری نسبت به یک مدل عمومی هم‌اندازه باشد.
PHP
Python
JavaScript
SQL

# Vision یا VL یعنی چه؟

بعضی مدل‌ها فقط متن را پردازش نمی‌کنند. اصطلاحاتی مثل Vision، VL (Vision-Language) یا VLM به مدل‌هایی اشاره می‌کنند که قابلیت پردازش اطلاعات تصویری دارند. برای مثال Gemma 4 26B A4B از مدل‌های چندوجهی جدید گوگل است و برای ورودی‌های تصویری و متنی ارائه شده است.
1
عکس — ورودی تصویری
2
Vision Encoder — تبدیل تصویر به Token
3
مدل زبانی — پردازش ورودی ترکیبی
4
پاسخ متنی — تحلیل یا توصیف تصویر
به همین دلیل چنین مدلی می‌تواند مثلاً Screenshot، نمودار یا تصویر را تحلیل کند.

# Reasoning یا Thinking یعنی چه؟

در مدل‌های جدید، اصطلاحاتی مثل Reasoning، Thinking یا R1 هم زیاد دیده می‌شوند. این مدل‌ها برای مسائل چندمرحله‌ای و استدلالی بیشتر مورد توجه قرار گرفته‌اند.
1
سؤال — مسئله پیچیده
2
تحلیل — تجزیه مسئله
3
مراحل حل — گام‌به‌گام
4
نتیجه — پاسخ بررسی‌شده
نکته: Reasoning به معنی بهتر بودن مدل در همه کارها نیست. برای یک سؤال ساده، ممکن است یک مدل معمولی سریع‌تر و مناسب‌تر باشد. اما برای مسائل پیچیده ریاضی، برنامه‌نویسی یا استدلال چندمرحله‌ای، مدل‌های reasoning می‌توانند مزیت داشته باشند.

# Distill یعنی چه؟

برای مثال DeepSeek-R1-Distill-Qwen-32B یک مدل Distill شده از خانواده DeepSeek-R1 است. ایده Knowledge Distillation این است که مدل بزرگ‌تر نقش Teacher را دارد و مدل کوچک‌تر Student است. هدف این است که مدل کوچک‌تر بتواند بخشی از توانایی‌های مدل بزرگ‌تر را یاد بگیرد، بدون اینکه لازم باشد به همان اندازه بزرگ باشد.
T
مدل Teacher (بزرگ)
DeepSeek-R1 — توانایی استدلال کامل
انتقال دانش
رفتار / خروجی / الگوهای استدلال
S
مدل Student (کوچک)
Qwen-32B — از Teacher یاد می‌گیرد، بسیار کوچک‌تر

# Q4، Q5 و Q8 چیستند؟

حالا می‌رسیم به چیزی که برای کاربران LM Studio، llama.cpp و اجرای Local AI بسیار مهم است: Quantization. مدل اصلی با دقت بالایی ذخیره شده است (مثلاً FP32 یا BF16) اما حجم زیادی دارد. Quantization دقت نمایش وزن‌ها را کاهش می‌دهد تا حجم مدل و حافظه موردنیاز کمتر شود.
32
FP32 — 32-bit float
بالاترین دقت، بزرگ‌ترین حجم
16
BF16 / FP16 — 16-bit
دقت نصف، تعادل خوب
8
8-bit
کوچک‌تر، افت کیفیت جزئی
4
4-bit
بسیار کوچک‌تر، RAM/VRAM کمتر
مهم: Q4 به این معنی نیست که مدل «4 برابر ضعیف‌تر» شده است. Q4 تقریباً به سطح 4-bit Quantization اشاره می‌کند. شما یک معامله بین حجم و کیفیت انجام می‌دهید.

# Q4_K_M چیست؟

اسم‌هایی مثل Q4_K_M، Q5_K_M، Q6_K و Q8_0 روش‌های مختلف Quantization در اکوسیستم llama.cpp هستند. Q4_K_M یک روش مشخص از خانواده K-Quant است که می‌تواند برای بخش‌های مختلف مدل از دقت‌های متفاوتی استفاده کند تا تعادل بهتری بین حجم و کیفیت ایجاد شود.
Q4_K_M
4-bit، K-Quant متوسط
Q5_K_M
5-bit، K-Quant متوسط
Q6_K
6-bit، K-Quant
Q8_0
8-bit، نزدیک به بدون افت

# GGUF چیست؟

پسوند .gguf یک فرمت فایل مدل است که در اکوسیستم llama.cpp و ابزارهای سازگار با آن بسیار استفاده می‌شود. اگر با LM Studio کار کرده باشید، احتمالاً بارها فایل‌های GGUF دیده‌اید.
1
مدل — وزن‌های آموزش‌دیده
2
GGUF — تبدیل به فرمت فایل
3
llama.cpp — بارگذاری و اجرا
4
اجرای Local — روی سیستم شما

# Context Length چیست؟

اعدادی مثل 8K، 32K، 128K یا 256K معمولاً به Context Length مربوط است — مقدار اطلاعاتی که مدل می‌تواند در یک تعامل در محدوده توجه خود داشته باشد.
8K
Context کوتاه
32K
Context متوسط
128K
Context بلند
256K
Context بسیار بلند
مهم: 128K Context یعنی حدود 128 هزار Token، نه 128 هزار کلمه. یک Token ممکن است بخشی از یک کلمه، یک کلمه، علامت یا ترکیبی از بخش‌های متن باشد. تعداد Tokenها به زبان و متن مورد استفاده هم وابسته است.

# Token چیست؟

مدل زبان، متن را الزاماً به شکل کلمه‌های کامل نمی‌بیند. متن ابتدا توسط Tokenizer به Tokenها تقسیم می‌شود.
1
متن — رشته ورودی خام
2
Tokenizer — تقسیم به قطعات
3
Tokenها — واحدهای زیرکلمه‌ای
4
مدل — پردازش Tokenها

# Thinking و Non-Thinking

در مدل‌های جدیدتر ممکن است حتی یک خانواده مدل چند حالت مختلف داشته باشد. برای مثال Qwen3 قابلیت‌های Thinking و Non-Thinking را ارائه می‌کند.
Non-Thinking

پاسخ‌های مستقیم و سریع

  • پاسخ مستقیم‌تر
  • معمولاً سریع‌تر
  • مناسب کارهای ساده
Thinking

استدلال عمیق قبل از پاسخ

  • مراحل استدلال بیشتر
  • بهتر برای مسائل پیچیده
  • کم‌سرعت‌تر اما دقیق‌تر

# Fine-Tuning چیست؟

در Fine-tuning، مدل دوباره روی داده‌های هدف آموزش داده می‌شود تا برای وظیفه خاصی بهتر تنظیم شود. این با Quantization کاملاً متفاوت است.
1
مدل عمومی — قابلیت‌های گسترده
2
Fine-Tuning — آموزش مجدد روی داده خاص
3
مدل تخصصی — بهینه برای یک وظیفه
به یاد داشته باشید: Quantization بیشتر درباره نحوه نمایش و ذخیره وزن‌ها است. Fine-tuning درباره تغییر خود مدل از طریق آموزش بیشتر است.

# حالا یک اسم واقعی را کامل بخوانیم

برگردیم به Qwen3-30B-A3B-Instruct-2507. حالا دیگر می‌توانیم آن را تقریباً مثل یک شناسنامه بخوانیم:
Q3
Qwen3
خانواده / نسل مدل
30
30B
≈ ۳۰.۵ میلیارد پارامتر کل
A3
A3B
≈ ۳.۳ میلیارد پارامتر فعال (MoE)
I
Instruct
تنظیم‌شده برای دنبال کردن دستورها
2507
شناسه نسخه / انتشار
مشخصات رسمی Qwen همین مدل را با 30.5B پارامتر کل، 3.3B پارامتر فعال، 128 Expert و 256K Context معرفی می‌کند. یعنی یک اسم نسبتاً کوتاه، اطلاعات زیادی در خودش دارد.

# و یک مثال دیگر

مثلاً DeepSeek-R1-Distill-Qwen-32B:
R1
DeepSeek-R1
مدل / خانواده مبنا
D
Distill
نسخه Distilled — دانش منتقل‌شده
Qwen-32B
مدل پایه Qwen با اندازه ~32B

# و یک مثال از MoE جدیدتر

مدل واقعی دیگری که همین الگوی نام‌گذاری را به شکل واضح نشان می‌دهد: Gemma-4-26B-A4B. در اینجا 26B به اندازه کلی مدل اشاره دارد و A4B به تعداد پارامترهای فعال. Google این مدل را به‌عنوان یک مدل چندوجهی قابل استفاده با ورودی تصویر و متن ارائه کرده است.
26B
کل پارامترها
A4B
پارامترهای فعال (MoE)
چندوجهی
ورودی تصویر + متن

# پس کدام فایل را دانلود کنیم؟

فرض کنید برای یک مدل چند فایل می‌بینید. اینجا یک راهنمای ساده است:
Q4
  • حافظه محدود؟ انتخاب خوب
  • کوچک‌ترین حجم
Q5
  • تعادل خوب
  • حجم در برابر کیفیت
Q6
  • کیفیت بالاتر
  • نیاز به حافظه بیشتر
Q8
  • نزدیک به بدون افت
  • بزرگ‌ترین حجم
مهم: این‌ها قانون مطلق نیستند. کیفیت واقعی به مدل، روش Quantization، معماری، Runtime و حتی نوع کاری که انجام می‌دهید بستگی دارد.

# یک اشتباه مهم درباره A3B و حافظه

فرض کنید می‌بینیم 30B-A3B و می‌گوییم: «پس چون 3B فعال است، من فقط به اندازه یک مدل 3B حافظه لازم دارم.»
اشتباه

"A3B = فقط به حافظه 3B نیاز است"

  • تمام ۳۰.۵ میلیارد پارامتر باید در حافظه باشد
  • Expertها جابه‌جا می‌شوند، حذف نمی‌شوند
درست

"A3B = محاسبه کمتر برای هر Token"

  • کل مدل باید بارگذاری شود
  • اما inference سریع‌تر است

# راهنمای سریع

اینجا یک راهنمای سریع برای رایج‌ترین اصطلاحاتی که با آن‌ها مواجه می‌شوید:
7B / 32B
  • تعداد کل پارامترها
A3B / A4B
  • پارامترهای فعال در MoE
MoE
  • Mixture of Experts
Instruct
  • تنظیم‌شده برای دستور
Base
  • مدل پایه
Coder
  • تمرکز روی برنامه‌نویسی
Vision / VL
  • پردازش تصویر
Reasoning
  • استدلال چندمرحله‌ای
Q4 / Q8
  • سطح Quantization
GGUF
  • فرمت فایل مدل
128K / 256K
  • Context Length
Token
  • واحد پردازش متن

# یک مدل را از روی اسمش انتخاب نکنیم

حالا شاید مهم‌ترین نکته مقاله همین باشد. وقتی می‌بینیم 70B، نباید فوراً بگوییم: «این بهتر است.» وقتی می‌بینیم Q8، نباید بگوییم: «این بهترین است.» وقتی می‌بینیم A3B، نباید بگوییم: «این فقط یک مدل 3B است.» و وقتی می‌بینیم Instruct، نباید فکر کنیم: «پس در همه کارها بهترین انتخاب است.»
اسم مدل فقط یک سرنخ است. برای انتخاب واقعی باید این موارد را کنار هم ببینیم:
معماری
پارامترها
پارامترهای فعال
آموزش
Context
Quantization
سخت‌افزار
وظیفه شما

# حالا دیگر اسم مدل‌ها رمز نیست

دفعه بعد که وارد صفحه دانلود یک مدل شدید و دیدید Qwen3-30B-A3B-Instruct-2507-Q4_K_M.gguf، می‌توانید آن را تکه‌تکه کنید:
Q3
Qwen3
خانواده مدل
30
30B
کل پارامترها
A3
A3B
پارامترهای فعال در MoE
I
Instruct
دنبال کردن دستورها
25
2507
نسخه / انتشار
Q4
Q4_K_M
روش Quantization
GGUF
فرمت فایل برای llama.cpp
و ناگهان چیزی که چند دقیقه قبل شبیه یک رمز عبور بود، تبدیل می‌شود به شناسنامه فنی یک هوش مصنوعی.

# سخن آخر

ما معمولاً وقتی با یک هوش مصنوعی کار می‌کنیم، فقط خروجی آن را می‌بینیم. اما پشت همان پاسخ کوتاه، میلیاردها پارامتر، معماری‌های پیچیده، Expertهای مختلف، Tokenها، Context، روش‌های Quantization و مراحل مختلف آموزش قرار گرفته‌اند. حتی اسم مدل هم بخشی از همین داستان را برای ما تعریف می‌کند.
30B به ما درباره اندازه مدل می‌گوید. A3B درباره بخش فعال آن. Instruct درباره نحوه آموزش آن. Q4_K_M درباره نحوه فشرده‌سازی آن. GGUF درباره فرمت فایل آن. و وقتی این زبان را یاد بگیریم، انتخاب مدل دیگر یک حدس تصادفی نیست.
takeaway.txt
دفعه بعد که یک اسم عجیب دیدید،
به‌جای رد شدن از کنارش، آن را بخوانید؛
شاید کل داستان مدل همان‌جا نوشته شده باشد.