# یک مدل هوش مصنوعی از چه چیزی ساخته شده است؟
قبل از اینکه سراغ نام مدلها برویم، باید یک مفهوم اساسی را بشناسیم: پارامتر. اگر بخواهیم خیلی ساده نگاه کنیم، یک مدل زبانی بزرگ مجموعه عظیمی از اعداد است که در فرایند آموزش تغییر کردهاند. مدل با دیدن حجم زیادی از داده، این پارامترها را طوری تنظیم میکند که بتواند الگوهای زبان، کد، منطق و اطلاعات موجود در دادههای آموزشی را یاد بگیرد.
نکته کلیدی: وقتی اعدادی مثل
7B، 14B یا 32B کنار نام یک مدل میبینید، معمولاً به تعداد پارامترهای آن اشاره دارند.
# 7B، 14B و 32B یعنی چه؟
حرف B مخفف Billion یا میلیارد است. بنابراین:
7B
≈ ۷ میلیارد پارامتر
14B
≈ ۱۴ میلیارد پارامتر
32B
≈ ۳۲ میلیارد پارامتر
70B
≈ ۷۰ میلیارد پارامتر
برای مثال، وقتی
Llama-3.1-8B را میبینید، 8B یعنی این مدل در حدود ۸ میلیارد پارامتر دارد.
اشتباه رایج: پارامتر بیشتر الزاماً به معنی مدل بهتر نیست. مدل 32B لزوماً در همه کارها بهتر از مدل 14B نیست. معماری مدل، کیفیت دادههای آموزشی، روش آموزش و تنظیمات پساآموزش همگی اهمیت دارند.
# A3B چیست؟
اینجا اسم مدلها کمی عجیبتر میشود. مثلاً
Qwen3-30B-A3B-Instruct-2507. قسمت 30B-A3B یک نکته بسیار مهم درباره معماری مدل را نشان میدهد. این یک مدل Mixture of Experts یا MoE است که در مجموع حدود 30.5 میلیارد پارامتر دارد، اما حدود 3.3 میلیارد پارامتر آن در هر Token فعال میشود.
ایده این است که مدل مجبور نیست برای پردازش هر Token از تمام متخصصهای خود استفاده کند. یک Router انتخاب میکند چه متخصصهایی برای آن ورودی مناسبترند.
1
سؤال — ورودی دریافت میشود
2
Router — تصمیم میگیرد کدام Expertها استفاده شوند
3
انتخاب Expertها — ۸ مورد از ۱۲۸ مورد
4
پردازش — فقط ≈ ۳.۳ میلیارد پارامتر فعال
5
پاسخ — خروجی تولید میشود
نکته مهم:
A3B به این معنی نیست که این مدل از نظر حافظه دقیقاً مثل یک مدل 3B است. پارامترهای کل مدل همچنان باید برای Expertهای مختلف در دسترس باشند. 30B-A3B ≠ 3B.
# Dense و MoE چه فرقی دارند؟
در یک مدل Dense، محاسبات هر Token بهصورت متراکم در کل شبکه انجام میشود. اما در MoE، فقط بخشی از Expertها برای هر Token انتخاب میشوند. این معماری به سازندگان مدل اجازه میدهد ظرفیت پارامتری بسیار بزرگی داشته باشند، بدون اینکه هزینه محاسبات هر Token دقیقاً به اندازه فعالسازی تمام پارامترهای مدل باشد.
مدل Dense
تمام پارامترها برای هر Token فعال
- ورودی → تمام بخشهای مدل → خروجی
- محاسبه کامل برای هر Token
- معماری سادهتر
مدل MoE
فقط Expertهای انتخابشده فعال میشوند
- ورودی → Router → Expertهای انتخابشده → خروجی
- محاسبه جزئی برای هر Token
- ظرفیت بزرگ، هزینه محاسبات کمتر
# Instruct یعنی چه؟
یکی از پرتکرارترین کلماتی که در اسم مدلها میبینیم Instruct است.
Instruct به مدلهایی اشاره میکند که برای دنبال کردن دستورهای کاربر تنظیم شدهاند. مدل پایه بیشتر برای پیشبینی و ادامه متن آموزش دیده، اما در مدل Instruction-Tuned، مدل برای تعامل با دستورها آماده شده است:
خلاصهسازی
- "این متن را خلاصه کن"
کدنویسی
- "این کد را اصلاح کن"
ترجمه
- "این متن را به فارسی ترجمه کن"
ایجاد
- "یک تابع PHP بنویس"
1
مدل پایه — آموزش روی داده خام
2
Instruction Tuning — یادگیری دنبال کردن دستور
3
مدل Instruct — آماده برای استفاده روزمره
به همین دلیل اگر هدف شما استفاده روزمره، گفتوگو یا اجرای دستور است، معمولاً نسخه Instruct انتخاب مناسبتری است.
# Base یعنی چه؟
در مقابل Instruct ممکن است با Base مواجه شوید. Base یعنی مدل پایه — نقطه شروع برای توسعه، Fine-tuning یا کاربردهای خاص.
Base
نقطه شروع برای توسعه
- پیشبینی و ادامه متن
- برای Fine-tuning و تحقیق
Instruct
آماده برای تعامل با کاربر
- دنبال کردن دستورها
- بهینه برای گفتوگو
# Coder یعنی چه؟
مدلهایی با نام Coder معمولاً برای کارهای برنامهنویسی هدفگذاری یا تنظیم شدهاند. برای مثال خانوادههایی مثل Qwen-Coder یا DeepSeek-Coder. اگر هدف اصلی شما برنامهنویسی است، یک مدل Coder میتواند انتخاب منطقیتری نسبت به یک مدل عمومی هماندازه باشد.
PHP
Python
JavaScript
SQL
# Vision یا VL یعنی چه؟
بعضی مدلها فقط متن را پردازش نمیکنند. اصطلاحاتی مثل Vision، VL (Vision-Language) یا VLM به مدلهایی اشاره میکنند که قابلیت پردازش اطلاعات تصویری دارند. برای مثال Gemma 4 26B A4B از مدلهای چندوجهی جدید گوگل است و برای ورودیهای تصویری و متنی ارائه شده است.
1
عکس — ورودی تصویری
2
Vision Encoder — تبدیل تصویر به Token
3
مدل زبانی — پردازش ورودی ترکیبی
4
پاسخ متنی — تحلیل یا توصیف تصویر
به همین دلیل چنین مدلی میتواند مثلاً Screenshot، نمودار یا تصویر را تحلیل کند.
# Reasoning یا Thinking یعنی چه؟
در مدلهای جدید، اصطلاحاتی مثل Reasoning، Thinking یا R1 هم زیاد دیده میشوند. این مدلها برای مسائل چندمرحلهای و استدلالی بیشتر مورد توجه قرار گرفتهاند.
1
سؤال — مسئله پیچیده
2
تحلیل — تجزیه مسئله
3
مراحل حل — گامبهگام
4
نتیجه — پاسخ بررسیشده
نکته: Reasoning به معنی بهتر بودن مدل در همه کارها نیست. برای یک سؤال ساده، ممکن است یک مدل معمولی سریعتر و مناسبتر باشد. اما برای مسائل پیچیده ریاضی، برنامهنویسی یا استدلال چندمرحلهای، مدلهای reasoning میتوانند مزیت داشته باشند.
# Distill یعنی چه؟
برای مثال
DeepSeek-R1-Distill-Qwen-32B یک مدل Distill شده از خانواده DeepSeek-R1 است. ایده Knowledge Distillation این است که مدل بزرگتر نقش Teacher را دارد و مدل کوچکتر Student است. هدف این است که مدل کوچکتر بتواند بخشی از تواناییهای مدل بزرگتر را یاد بگیرد، بدون اینکه لازم باشد به همان اندازه بزرگ باشد.
T
مدل Teacher (بزرگ)
DeepSeek-R1 — توانایی استدلال کامل
↓
انتقال دانش
رفتار / خروجی / الگوهای استدلال
S
مدل Student (کوچک)
Qwen-32B — از Teacher یاد میگیرد، بسیار کوچکتر
# Q4، Q5 و Q8 چیستند؟
حالا میرسیم به چیزی که برای کاربران LM Studio، llama.cpp و اجرای Local AI بسیار مهم است: Quantization. مدل اصلی با دقت بالایی ذخیره شده است (مثلاً FP32 یا BF16) اما حجم زیادی دارد. Quantization دقت نمایش وزنها را کاهش میدهد تا حجم مدل و حافظه موردنیاز کمتر شود.
32
FP32 — 32-bit float
بالاترین دقت، بزرگترین حجم
16
BF16 / FP16 — 16-bit
دقت نصف، تعادل خوب
8
8-bit
کوچکتر، افت کیفیت جزئی
4
4-bit
بسیار کوچکتر، RAM/VRAM کمتر
مهم:
Q4 به این معنی نیست که مدل «4 برابر ضعیفتر» شده است. Q4 تقریباً به سطح 4-bit Quantization اشاره میکند. شما یک معامله بین حجم و کیفیت انجام میدهید.
# Q4_K_M چیست؟
اسمهایی مثل
Q4_K_M، Q5_K_M، Q6_K و Q8_0 روشهای مختلف Quantization در اکوسیستم llama.cpp هستند. Q4_K_M یک روش مشخص از خانواده K-Quant است که میتواند برای بخشهای مختلف مدل از دقتهای متفاوتی استفاده کند تا تعادل بهتری بین حجم و کیفیت ایجاد شود.
Q4_K_M
4-bit، K-Quant متوسط
Q5_K_M
5-bit، K-Quant متوسط
Q6_K
6-bit، K-Quant
Q8_0
8-bit، نزدیک به بدون افت
# GGUF چیست؟
پسوند
.gguf یک فرمت فایل مدل است که در اکوسیستم llama.cpp و ابزارهای سازگار با آن بسیار استفاده میشود. اگر با LM Studio کار کرده باشید، احتمالاً بارها فایلهای GGUF دیدهاید.
1
مدل — وزنهای آموزشدیده
2
GGUF — تبدیل به فرمت فایل
3
llama.cpp — بارگذاری و اجرا
4
اجرای Local — روی سیستم شما
# Context Length چیست؟
اعدادی مثل
8K، 32K، 128K یا 256K معمولاً به Context Length مربوط است — مقدار اطلاعاتی که مدل میتواند در یک تعامل در محدوده توجه خود داشته باشد.
8K
Context کوتاه
32K
Context متوسط
128K
Context بلند
256K
Context بسیار بلند
مهم:
128K Context یعنی حدود 128 هزار Token، نه 128 هزار کلمه. یک Token ممکن است بخشی از یک کلمه، یک کلمه، علامت یا ترکیبی از بخشهای متن باشد. تعداد Tokenها به زبان و متن مورد استفاده هم وابسته است.
# Token چیست؟
مدل زبان، متن را الزاماً به شکل کلمههای کامل نمیبیند. متن ابتدا توسط Tokenizer به Tokenها تقسیم میشود.
1
متن — رشته ورودی خام
2
Tokenizer — تقسیم به قطعات
3
Tokenها — واحدهای زیرکلمهای
4
مدل — پردازش Tokenها
# Thinking و Non-Thinking
در مدلهای جدیدتر ممکن است حتی یک خانواده مدل چند حالت مختلف داشته باشد. برای مثال Qwen3 قابلیتهای Thinking و Non-Thinking را ارائه میکند.
Non-Thinking
پاسخهای مستقیم و سریع
- پاسخ مستقیمتر
- معمولاً سریعتر
- مناسب کارهای ساده
Thinking
استدلال عمیق قبل از پاسخ
- مراحل استدلال بیشتر
- بهتر برای مسائل پیچیده
- کمسرعتتر اما دقیقتر
# Fine-Tuning چیست؟
در Fine-tuning، مدل دوباره روی دادههای هدف آموزش داده میشود تا برای وظیفه خاصی بهتر تنظیم شود. این با Quantization کاملاً متفاوت است.
1
مدل عمومی — قابلیتهای گسترده
2
Fine-Tuning — آموزش مجدد روی داده خاص
3
مدل تخصصی — بهینه برای یک وظیفه
به یاد داشته باشید: Quantization بیشتر درباره نحوه نمایش و ذخیره وزنها است. Fine-tuning درباره تغییر خود مدل از طریق آموزش بیشتر است.
# حالا یک اسم واقعی را کامل بخوانیم
برگردیم به
Qwen3-30B-A3B-Instruct-2507. حالا دیگر میتوانیم آن را تقریباً مثل یک شناسنامه بخوانیم:
Q3
Qwen3
خانواده / نسل مدل
30
30B
≈ ۳۰.۵ میلیارد پارامتر کل
A3
A3B
≈ ۳.۳ میلیارد پارامتر فعال (MoE)
I
Instruct
تنظیمشده برای دنبال کردن دستورها
★
2507
شناسه نسخه / انتشار
مشخصات رسمی Qwen همین مدل را با 30.5B پارامتر کل، 3.3B پارامتر فعال، 128 Expert و 256K Context معرفی میکند. یعنی یک اسم نسبتاً کوتاه، اطلاعات زیادی در خودش دارد.
# و یک مثال دیگر
مثلاً
DeepSeek-R1-Distill-Qwen-32B:
R1
DeepSeek-R1
مدل / خانواده مبنا
D
Distill
نسخه Distilled — دانش منتقلشده
★
Qwen-32B
مدل پایه Qwen با اندازه ~32B
# و یک مثال از MoE جدیدتر
مدل واقعی دیگری که همین الگوی نامگذاری را به شکل واضح نشان میدهد:
Gemma-4-26B-A4B. در اینجا 26B به اندازه کلی مدل اشاره دارد و A4B به تعداد پارامترهای فعال. Google این مدل را بهعنوان یک مدل چندوجهی قابل استفاده با ورودی تصویر و متن ارائه کرده است.
26B
کل پارامترها
A4B
پارامترهای فعال (MoE)
چندوجهی
ورودی تصویر + متن
# پس کدام فایل را دانلود کنیم؟
فرض کنید برای یک مدل چند فایل میبینید. اینجا یک راهنمای ساده است:
Q4
- حافظه محدود؟ انتخاب خوب
- کوچکترین حجم
Q5
- تعادل خوب
- حجم در برابر کیفیت
Q6
- کیفیت بالاتر
- نیاز به حافظه بیشتر
Q8
- نزدیک به بدون افت
- بزرگترین حجم
مهم: اینها قانون مطلق نیستند. کیفیت واقعی به مدل، روش Quantization، معماری، Runtime و حتی نوع کاری که انجام میدهید بستگی دارد.
# یک اشتباه مهم درباره A3B و حافظه
فرض کنید میبینیم
30B-A3B و میگوییم: «پس چون 3B فعال است، من فقط به اندازه یک مدل 3B حافظه لازم دارم.»
اشتباه
"A3B = فقط به حافظه 3B نیاز است"
- تمام ۳۰.۵ میلیارد پارامتر باید در حافظه باشد
- Expertها جابهجا میشوند، حذف نمیشوند
درست
"A3B = محاسبه کمتر برای هر Token"
- کل مدل باید بارگذاری شود
- اما inference سریعتر است
# راهنمای سریع
اینجا یک راهنمای سریع برای رایجترین اصطلاحاتی که با آنها مواجه میشوید:
7B / 32B
- تعداد کل پارامترها
A3B / A4B
- پارامترهای فعال در MoE
MoE
- Mixture of Experts
Instruct
- تنظیمشده برای دستور
Base
- مدل پایه
Coder
- تمرکز روی برنامهنویسی
Vision / VL
- پردازش تصویر
Reasoning
- استدلال چندمرحلهای
Q4 / Q8
- سطح Quantization
GGUF
- فرمت فایل مدل
128K / 256K
- Context Length
Token
- واحد پردازش متن
# یک مدل را از روی اسمش انتخاب نکنیم
حالا شاید مهمترین نکته مقاله همین باشد. وقتی میبینیم
70B، نباید فوراً بگوییم: «این بهتر است.» وقتی میبینیم Q8، نباید بگوییم: «این بهترین است.» وقتی میبینیم A3B، نباید بگوییم: «این فقط یک مدل 3B است.» و وقتی میبینیم Instruct، نباید فکر کنیم: «پس در همه کارها بهترین انتخاب است.»
اسم مدل فقط یک سرنخ است. برای انتخاب واقعی باید این موارد را کنار هم ببینیم:
معماری
پارامترها
پارامترهای فعال
آموزش
Context
Quantization
سختافزار
وظیفه شما
# حالا دیگر اسم مدلها رمز نیست
دفعه بعد که وارد صفحه دانلود یک مدل شدید و دیدید
Qwen3-30B-A3B-Instruct-2507-Q4_K_M.gguf، میتوانید آن را تکهتکه کنید:
Q3
Qwen3
خانواده مدل
30
30B
کل پارامترها
A3
A3B
پارامترهای فعال در MoE
I
Instruct
دنبال کردن دستورها
25
2507
نسخه / انتشار
Q4
Q4_K_M
روش Quantization
★
GGUF
فرمت فایل برای llama.cpp
و ناگهان چیزی که چند دقیقه قبل شبیه یک رمز عبور بود، تبدیل میشود به شناسنامه فنی یک هوش مصنوعی.
# سخن آخر
ما معمولاً وقتی با یک هوش مصنوعی کار میکنیم، فقط خروجی آن را میبینیم. اما پشت همان پاسخ کوتاه، میلیاردها پارامتر، معماریهای پیچیده، Expertهای مختلف، Tokenها، Context، روشهای Quantization و مراحل مختلف آموزش قرار گرفتهاند. حتی اسم مدل هم بخشی از همین داستان را برای ما تعریف میکند.
30B به ما درباره اندازه مدل میگوید. A3B درباره بخش فعال آن. Instruct درباره نحوه آموزش آن. Q4_K_M درباره نحوه فشردهسازی آن. GGUF درباره فرمت فایل آن. و وقتی این زبان را یاد بگیریم، انتخاب مدل دیگر یک حدس تصادفی نیست.
takeaway.txt
دفعه بعد که یک اسم عجیب دیدید،
بهجای رد شدن از کنارش، آن را بخوانید؛
شاید کل داستان مدل همانجا نوشته شده باشد.
بهجای رد شدن از کنارش، آن را بخوانید؛
شاید کل داستان مدل همانجا نوشته شده باشد.