رقابت میان غولهای فناوری چین برای ساخت مدلهای هوش مصنوعی هر روز جدیتر میشود. حالا علیبابا از جدیدترین و قدرتمندترین مدل خود با نام Qwen3.8-Max پرده برداشته؛ مدلی که از نظر ابعاد، تنها یک قدم با Kimi K3 محصول Moonshot AI فاصله دارد و نشان میدهد شرکتهای چینی دیگر تنها به دنبال رقابت داخلی نیستند، بلکه بازار جهانی توسعهدهندگان هوش مصنوعی را هدف گرفتهاند.
۲.۴ تریلیون پارامتر؛ اما آیا این عدد همه چیز را مشخص میکند؟
Qwen3.8-Max با ۲.۴ تریلیون پارامتر معرفی شده است. پارامترها همان مقادیر عددی هستند که مدل در طول فرایند آموزش یاد میگیرد و بر اساس آنها میتواند الگوها را تشخیص دهد، متن تولید کند، تصویر را تحلیل کند یا به پرسشهای کاربران پاسخ دهد. برای مقایسه، Kimi K3 که ماه گذشته معرفی شد، ۲.۸ تریلیون پارامتر دارد. Alibaba این مدل را بزرگترین و توانمندترین محصول هوش مصنوعی خود تا امروز میداند. OpenAI، Anthropic و Google برخلاف بسیاری از شرکتهای چینی، تعداد پارامترهای مدلهای متنباز خود را منتشر نمیکنند و به همین دلیل مقایسه مستقیم آنها از نظر اندازه امکانپذیر نیست. Alibaba Cloud نیز اعلام کرده این مدل از هفته آینده از طریق Model Studio در اختیار توسعهدهندگان قرار خواهد گرفت.
البته تعداد پارامترها همیشه معیار برتری یک مدل نیست. در سالهای اخیر مدلهایی با ابعاد کوچکتر بارها عملکرد بهتری نسبت به مدلهای بزرگتر داشتهاند. با این حال، این عدد هنوز یکی از شاخصهایی است که توسعهدهندگان و فعالان این صنعت برای تخمین قدرت محاسباتی و حجم دادههای آموزشی یک مدل به آن توجه میکنند. به همین دلیل شرکتهای چینی معمولاً این اطلاعات را منتشر میکنند تا اعتماد جامعه توسعهدهندگان را جلب کنند و شانس بیشتری برای استفاده از مدلهایشان در پروژههای مختلف داشته باشند.
معماری Mixture of Experts چگونه هزینه پردازش را کاهش میدهد؟
یکی از ویژگیهای مهم Qwen3.8-Max استفاده از معماری Mixture of Experts (MoE) است. در این روش، تمام بخشهای مدل بهطور همزمان فعال نمیشوند. سیستم بسته به نوع درخواست، تنها از بخشهای تخصصی موردنیاز استفاده میکند. نتیجه این طراحی، کاهش هزینه پردازش و افزایش سرعت پاسخگویی است. با وجود اینکه این مدل ۲.۴ تریلیون پارامتر دارد، در هر درخواست تنها حدود ۹۵ میلیارد پارامتر وارد فرایند پردازش میشوند؛ عددی که تأثیر مستقیمی بر کاهش مصرف منابع سختافزاری دارد.
از نظر تواناییها، Qwen3.8-Max یک مدل چندرسانهای محسوب میشود و میتواند متن، تصویر و ویدئو را پردازش کند. این مدل از پنجره متنی یک میلیون توکنی پشتیبانی میکند؛ ظرفیتی که امکان تحلیل همزمان حجم بسیار زیادی از اطلاعات را فراهم میکند. برای مثال، بررسی قراردادهای حقوقی طولانی، تحلیل صدها صفحه سند یا پردازش پروژههای بزرگ برنامهنویسی بدون نیاز به تقسیم فایلها به بخشهای کوچکتر، از کاربردهای چنین ظرفیتی است.
علیبابا در کنار معرفی این مدل اعلام کرده که Qwen3.8-Max توانسته یک پروژه مهندسی نرمافزار را ظرف ۱۶ روز به پایان برساند. هرچند جزئیات فنی این پروژه منتشر نشده، اما این ادعا نشان میدهد شرکت قصد دارد توانایی مدل را فراتر از تولید متن و مکالمه معرفی کند و آن را بهعنوان ابزاری برای انجام پروژههای واقعی توسعه نرمافزار مطرح کند.
عملکرد Qwen3.8-Max در رتبهبندیهای جهانی
عملکرد اولیه این مدل نیز توجه زیادی را جلب کرده است. Qwen3.8-Max در پلتفرم ارزیابی Arena.AI به بالاترین رتبه در میان مدلهای متنمحور چینی رسید. در رتبهبندی جهانی مدلهای بینایی نیز جایگاه دوم را به دست آورد و تنها پایینتر از یکی از نسخههای Claude Fable 5 قرار گرفت.
آنچه بیش از تعداد پارامترهای Qwen3.8-Max اهمیت دارد، رویکردی است که شرکتهای چینی در پیش گرفتهاند. تمرکز آنها دیگر فقط روی ساخت مدلهای بزرگتر نیست؛ هدف اصلی، ارائه مدلهایی است که با وجود قدرت پردازشی بالا، هزینه اجرای قابل قبولی داشته باشند. معماریهایی مانند MoE دقیقاً در همین مسیر توسعه پیدا کردهاند.
اگر این روند ادامه پیدا کند، رقابت آینده هوش مصنوعی دیگر صرفاً بین آمریکا و چین بر سر «بزرگترین مدل» نخواهد بود. برنده واقعی شرکتی است که بتواند بهترین توازن را میان عملکرد، هزینه و دسترسی توسعهدهندگان ایجاد کند؛ مسیری که به نظر میرسد علیبابا با Qwen3.8-Max جدیتر از همیشه وارد آن شده است.
زیلوش آخرین اخبار تکنولوژی 