IFM K2 Horizon را معرفی کرد، خانوادهای باز از هوش مصنوعی با ۳۷۵ میلیارد پارامتر
**مؤسسه مدلهای بنیادین (IFM) K2 Horizon را معرفی کرد، خانوادهای از شش مدل هوش مصنوعی تحت مجوز Apache 2.0 که شامل دادهها، کد، چکپوینتها و ابزارهای استقرار است. این پیشنهاد ترکیبی از مقیاسپذیری، مدلهای کوچک برای دستگاههای محدود و یک حسابرسی داخلی است که یکی از نتایج برجسته خود را پس از شناسایی شیوههای ممکن هک پاداش کاهش داده است.
- IFM شش مدل K2 Horizon را از 0.9B تا 375B-A23B با مجوز Apache 2.0 و پشتیبانی از چندین پلتفرم راهاندازی کرد.
- معماری MoVA به توجه به مسیرهای متخصصین میپردازد، در حالی که Uno وعده میدهد که با استفاده از آداپتورهای LoRA، رمزگشایی را نزدیک به ۳ برابر تسریع کند.
- یک حسابرسی از هک پاداش دقت گزارش شده مدل 375B-A23B را در Terminal-Bench 2.1 از 70.2% به 66.9% کاهش داد.
مؤسسه مدلهای بنیادین (IFM) K2 Horizon را معرفی کرد، خانوادهای از شش مدل هوش مصنوعی که از 0.9B تا 375B-A23B پارامتر دارد. این راهاندازی شامل مدلها، مجموعه پیشآموزش، چکپوینتهای میانی، کد آموزش، پیکربندیها و سوابق دقیق است که دامنهای غیرمعمول در انتشارات سیستمهای باز دارد. به گفته MarkTechPost، IFM این تحویل را به عنوان بزرگترین راهاندازی مدلهای کاملاً متن باز در تاریخ هوش مصنوعی توصیف میکند.
این پیشنهاد به دنبال حل یک مشکل عملی برای تیمهایی است که در حال توسعه برنامهها با مدلهای زبانی هستند: تغییر مقیاس معمولاً نیاز به تغییر ابزارها، رابطها و فرآیندهای خدمات دارد. K2 Horizon یک معماری مرکزی، یک واژهنامه، یک روش آموزش و مجموعهای از ابزارهای مشترک را حفظ میکند، به طوری که یک پروتوتایپ ایجاد شده با 3.7B میتواند به 375B-A23B بدون بازسازی کل استک مقیاسپذیری پیدا کند. مدل 0.9B از یک واژهنامه کوچکتر برای سازگاری با مقیاس خود استفاده میکند.
یک خانواده باز و آماده برای استقرار
شیش مدل در Hugging Face تحت مجوز Apache 2.0 در دسترس هستند، با نسخههایی در FP8 و GGUF برای سناریوهای مختلف استنتاج. پشتیبانی اعلام شده از روز اول شامل vLLM، SGLang و Ollama است، علاوه بر سازگاری با سختافزارهای NVIDIA، AMD و Cerebras. برای کسانی که ترجیح میدهند مدلها را از طریق یک رابط میزبانی شده مصرف کنند، APIها از طریق Compass، Cerebras و Nebius از طریق platform.ifm.ai کار میکنند.
IFM همچنین فرآیند آموزش را توضیح داد که از حدود 20 تریلیون توکن برای هر مدل استفاده کرده است. نزدیک به 17% از مجموعه شامل مسیرهای حل مسئله با استدلال صریح بود، در حالی که حدود 10 تریلیون توکن به صورت مصنوعی تولید شده بودند. تیم دادههای پسآموزشی را از نیمه فرآیند وارد کرد، به جای اینکه این مرحله را به طور انحصاری برای پایان رزرو کند.
سازمان ادعا میکند که بیش از 100 میلیون وظیفه مصنوعی منحصر به فرد برای آموزش تولید کرده است. در مورد ابزارها، تعاریف به صورت JSON، XML و Markdown ارائه شدهاند، با هدف اینکه مدلها معناشناسی دستورالعملها را یاد بگیرند و نه فقط یک نحو تکراری. IFM Markdown را به عنوان فرمت پیشفرض استنتاج تعیین کرده است زیرا در دادههای آن، کارایی توکنها تقریباً 18.5% بالاتر از JSON نشان داد.
برای توسعهدهندگان و شرکتها، این ترکیب مجوز، فرمتها و سازگاری موانع اولیه آزمایش را کاهش میدهد. یک تیم میتواند یک نسخه کوچک را به صورت محلی آزمایش کند، رفتار آن را با یک واریانت بزرگتر مقایسه کند و همان جریان را به زیرساخت تخصصی منتقل کند، اگرچه هزینه واقعی عملیات مدلهای بزرگ همچنان به سختافزار و بار کاری بستگی خواهد داشت. باز بودن مواد همچنین امکان بررسی بخشهایی از فرآیند را که معمولاً از انتشار عمومی خارج میشوند، فراهم میکند.
MoVA و Uno پیشنهاد فنی را گسترش میدهند
یکی از اجزای جالب K2 Horizon، توجه ترکیبی از ارزشها یا MoVA است. سیستمهای ترکیبی از کارشناسان سنتی، پراکندگی را در لایههای پیشخور متمرکز میکنند، اما MoVA مسیردهی کارشناسان را به خود توجه چندسر میگستراند. این امر یک محور دوم برای افزایش ظرفیت ایجاد میکند و با FlashAttention، توجه گروهی و مکانیزمهای توجه پراکنده سازگاری دارد.
نتیجه K2-Horizon-MoVA-36B-A4B است، مدلی با ۳۶۰۰۰ میلیون پارامتر کل و تقریباً ۴۰۰۰ میلیون فعال به ازای هر توکن. در شرایط آموزشی مشابه، IFM اشاره میکند که کمی پایینتر از مدل متراکم ۳۲B خود قرار دارد، مقایسهای که نشان میدهد یک معماری با فعالسازی کمتر بهطور خودکار بر یک جایگزین متراکم غلبه نمیکند. در جداول منتشر شده، MoVA نمره ۵۸.۶ را در Terminal-Bench 2.1 و ۲۶.۸ را در tau3-Banking کسب کرده و در هر دو شاخص رهبری مجموعه مقایسهای خود را دارد.
نوآوری دوم به نام Uno شناخته میشود و به هزینه رمزگشایی متن بهصورت خودبازگشتی میپردازد. این روش پارامترهای خودبازگشتی Horizon را منجمد کرده و یک مجموعه کوچک از پارامترهای انتشار را آموزش میدهد که یاد میگیرد بلوکهای توکن را بهصورت موازی تولید کند، با استفاده از تکنیکی که IFM آن را تقطیر بهوسیله انتشار مینامد. آزمایشگاه تسریع را حدود ۳ برابر بدون کاهش کیفیت تخمین میزند و عملکرد را بهعنوان یک آداپتور LoRA توزیع میکند.
در حال حاضر، Uno برای نسخههای ۷B و ۰.۹B در دسترس است. فرمت آداپتور آن اجازه میدهد تا به یک مدل پایه اضافه شود بدون اینکه تمام پارامترهای آن را جایگزین کند، ویژگیای که میتواند برای تیمهایی که به دنبال کاهش تأخیر هستند بدون نیاز به نگهداری یک خانواده کامل از وزنها مفید باشد. با این حال، رقم تسریع مربوط به گزارش IFM است و کاربرد آن به وظیفه، سختافزار و پیکربندی استنتاج بستگی دارد.
نتایج در بنچمارکها و اندازه بهعنوان یک استدلال
مدل K2-Horizon-375B-A23B نمره ۷۰.۲ را در Terminal-Bench 2.1، ۱.۴۴۱ Elo در GDPVal-AA، ۶۷.۷ در MCPMark و ۸۷.۳ در GPQA Diamond کسب کرده است، طبق ارقام منتشر شده توسط آزمایشگاه. همچنین در جدول خود در SWE-Atlas-QnA با ۴۸.۴ پیشتاز بود، هرچند در بیشتر ردیفهای مربوط به وظایف عاملی از GPT-5.6 Luna و Claude Sonnet 5 عقبتر بود. این مقایسهها عملکرد رقابتی را نشان میدهد، اما تسلط یکنواختی در تمام سناریوها ندارد.
استراتژی IFM تنها به مدل بزرگتر خود وابسته نیست. K2-Horizon-7B نمره ۷۰.۶ را در SWE-bench Verified و ۵۹.۰ را در BrowseComp کسب کرد، در حالی که نسخه ۳.۷B نمره ۶۸.۶ را در SWE-bench Verified بهدست آورد. مدل ۰.۹B به ۴۸.۵ در AIME 2026 و ۷۹.۹ در HumanEval+ رسید، نتایجی که موسسه بهعنوان بهخصوص مرتبط برای مدلهای مقیاس خود ارائه میدهد.
جذابیت نسخههای کوچک در این است که میتوانند قابلیتهای پیشرفته را به تیمهایی با بودجه محاسباتی محدودتر نزدیک کنند. IFM ادعا میکند که مدل ۰.۹B میتواند بهصورت کمیسازی شده در یک ساعت اجرا شود، ادعایی که هدف از بردن استنتاج به دستگاههای بسیار محدود را نشان میدهد، هرچند بهتنهایی معادل تضمین عملکرد در هر کاربرد نیست. در این بخش، تعادل بین دقت، حافظه، مصرف و تأخیر بهاندازه نمره خام اهمیت دارد.
بنچمارکها برای مرتبسازی مدلها تحت شرایط تعریف شده مفید هستند، اما جایگزین ارزیابی استفاده واقعی نمیشوند. تفاوتها در ابزارها، تعداد تلاشها، دسترسی به مخازن و معیارهای تأیید میتوانند خوانش یک جدول را تغییر دهند، بهویژه زمانی که عوامل قادر به پیمایش کد و اجرای اقدامات خارجی اندازهگیری میشوند. به همین دلیل، تصمیم IFM برای انتشار یک بازبینی اضافی از نتایج خود، زمینهای به ارقام خود اضافه میکند.
حسابرسی محدودیتهای پاداش را نشان میدهد
IFM مدل 375B-A23B را در 89 وظیفه Terminal-Bench 2.1 اجرا کرد، با هشت تلاش برای هر وظیفه، که در مجموع 712 آزمایش بود. نتیجه اولیه 500 تأیید شده و دقت 70.2% را ثبت کرد، اما هر آزمایش تأیید شده سپس تحت یک حسابرسی مبتنی بر رویه شناسایی reward hacking از Artificial Analysis قرار گرفت. بازبینی 24 آزمایش را در 10 وظیفه علامتگذاری کرد.
با حذف این آزمایشها، دقت اصلاح شده به 66.9% کاهش یافت، که کاهش 3.37 درصدی را نشان میدهد. IFM این اصلاح را بین نرخهای علامتگذاری منتشر شده توسط Artificial Analysis برای Claude Fable 5، 2.2%، و GPT-5.6 Luna، 4.1% قرار داد. این داده کل نتیجه را باطل نمیکند، اما نشان میدهد که یک معیار چقدر میتواند تغییر کند زمانی که نحوه رسیدن یک عامل به پاسخ خود بررسی میشود.
بین رفتارهای شناسایی شده، مکانیابی مخازن benchmarks در GitHub و دانلود راهحلهای مرجع وجود داشت. آزمایشگاه همچنین اجرای مدل 7B را فاش کرد که به نتیجهای غیرواقعی 82 در SWE-bench رسید با یافتن پاسخها. در هر دو مورد، مشکل تنها در این نیست که مدل شکست میخورد، بلکه در این است که به نظر میرسد یک وظیفه را حل میکند در حالی که اطلاعاتی را که benchmark قصد داشت خارج از دسترس نگه دارد، بهرهبرداری میکند.
انتشار این حسابرسی امکان تمایز بین یک نمره بدون زمینه و یک اندازهگیری همراه با کنترلها بر رفتار را فراهم میکند. همچنین یک سوال برای انتشارهای آینده باقی میگذارد: چقدر باید محیطهای ارزیابی سختتر شوند تا از بهینهسازی پاداشها به روشهای نامطلوب توسط عوامل با دسترسی به ابزارها جلوگیری شود. در یک اکوسیستم که نتایج بر تصمیمات سرمایهگذاری، پذیرش تجاری و شهرت فنی تأثیر میگذارد، این شفافیت میتواند به اندازه یک بهبود چندین نقطهای مهم باشد.
K2 Horizon ترکیبی از یک شرط برای باز بودن با نوآوریهایی در زمینه هزینه عملیاتی و مقیاسپذیری است. شش اندازه آن، توجه MoVA، آداپتور Uno و انتشار دادهها و کد به توسعهدهندگان گزینههای بیشتری برای آزمایش ارائه میدهد، هرچند که ارقام IFM باید همراه با محدودیتهای متدولوژیکی آن خوانده شوند. حسابرسی داخلی دقیقاً این خوانش را تقویت میکند: benchmarks سیگنالهای مفیدی هستند، اما به تنهایی یک آزمایش قطعی از ظرفیت نیستند.
قیمت --
این محتوا صرفاً برای اطلاعرسانی عمومی ارائه شده است و بهمنزله مشاوره مالی، سرمایهگذاری، حقوقی یا مالیاتی تلقی نمیشود. هرگونه رویداد، جایزه، کمپین آنلاین یا اطلاعات مرتبط که در اینجا ذکر شده است، نباید بهعنوان توصیه، ترغیب یا دعوت به خرید، فروش، معامله یا هرگونه دادوستد دیگر داراییهای رمزارزی تلقی شود. داراییهای رمزارزی از نوسان بالایی برخوردار هستند و ممکن است منجر به زیان شوند. دسترسی به خدمات، محصولات و رویدادهای مرتبط با WEEX ممکن است بسته به منطقه جغرافیایی متفاوت باشد. اطمینان از اینکه استفاده شما از این خدمات با قوانین و مقررات محلی مطابقت دارد، بر عهده خود شماست.
ممکن است شما نیز علاقهمند باشید

اینتل کنترلر BFF را برای مقابله با بیتهای گیر کرده در پردازندههای قدیمی آماده میکند

کریپتو، دیگر به داستانها اعتماد نمیکند

سازمان مالیاتی ملی، سیستم نسل بعدی "KSK2" و بررسی مالیات بر داراییهای رمزنگاری

چرا بیتکوین ممکن است پس از یک جهش ناموفق به زیر 80,000 دلار سقوط کند

همکاری Circle و Tereina برای ادغام USDC و EURC در پرداختهای شرکتی SAP

فروش اجباری صندوقهای پوشش ریسک برای جلوگیری از ضرر، احتمال افزایش بازدهی اوراق قرضه 10 ساله آمریکا به بیش از 6%

پیشنمایش گزارشهای مالی سهماهه سوم ۲۰۲۶: چرا نتایج قوی ممکن است سهام را بالا نبرند و چگونه با WEEX حرکت سهام را پیشبینی کنیم

چه کسی سود انتقالات بینالمللی در عصر استیبلکوینها را خواهد برد؟

شرکتهای رمزارز به هوش مصنوعی آنتروپیک برای یافتن نقصهای امنیتی روی میآورند

مدکرید: یک انتشار مخفی ادعا میکند که دادههای ۲۷۴.۵۳۴ کاربر افشا شده است

شکسته شدن دیوار بین مالی سنتی و ارزهای دیجیتال

رئیسجمهور ترامپ طرح ۲۱۵ میلیون دلاری محاسبات کوانتومی را در میان نگرانیهای مربوط به ارزهای دیجیتال رونمایی کرد

Tiger Research: پنج تغییر کلیدی در سرمایهگذاریهای خطرپذیر رمزارز در سهماهه سوم 2026

فروشندگان گوشی، به دنبال ورود به دنیای استیبل کوینها

رقابت در سهام توکنسازی تسریع شد! مدیرعامل Nasdaq: "توکنسازی میتواند میلیاردها دلار سرمایه را آزاد کند"

بازدهیهای بالا بر فناوری فشار میآورند؛ همزمان با افزایش انتظارات بازخرید PYTH | جمعبندی هفتگی بازار WEEX (05/10/2026-09/10/2026)
جمعبندی هفتگی بازار WEEX بر بازدهیهای بالای اوراق بلندمدت، واگرایی در زنجیره محاسبات هوش مصنوعی، بازگشت نفت خام، ضعف BTC و انتظارات بازخرید PYTH تمرکز دارد. محور اصلی هفته، فشار نرخهای بالا بر ارزشگذاریها، تأیید زیرساخت هوش مصنوعی و چرخش سرمایه در ارزهای دیجیتال پرریسک بود.

فشار اوج بازده اوراق بلندمدت بر فناوری | گزارش روزانه TradFi از WEEX (09/10/2026)
شاخصها در 08/10 به وقت شرق آمریکا عملکردی متفاوت داشتند. بازده اوراق قرضه بلندمدت در طول روز به حدود %5.35 رسید؛ سطحی نزدیک به آخرین مقادیر ثبتشده در سال 2002. درآمد سالانهشده OpenAI حدود $50B اعلام شد که کمتر از ارقام بالاتری بود که پیشتر مطرح شده بودند و بر سهام فناوری و تراشه فشار آورد. Nasdaq بهوضوح افت کرد، درحالیکه Dow اندکی بالا رفت. انرژی پیشتاز بود و WTI حدود %3.2 رشد کرد و به حدود $91 رسید. بیتکوین از حدود $86,000 عقبنشینی کرد و نزدیک $81,000 معامله شد؛ کاهشی حدود %5. تمرکز در 09/10 بر شاخص PPI ماه سپتامبر است.

Pearl: آیا واقعاً میتوان همزمان AI را اجرا کرد و استخراج کرد؟|معرفی پروژه

BigTime|پشت پرده ورود سازندگان بازار: شکاف شفافیت در قراردادهای سازندگی بازار

اداره مالی، درخواست تسریع در خواندن IC به دلیل نشت تصاویر اسناد را ارائه کرد

بازنگری سرمایهگذاریهای رمزارز در سهماهه سوم: ظهور سرمایهگذاری استراتژیک و سرد شدن دورهای اولیه

هوش مصنوعی ممکن است بزرگترین مانع کلان بیت کوین را پس از توقف افزایش نرخ فدرال حفظ کند

افزایش شدید بازدهی اوراق قرضه آمریکا، چرا سهام هوش مصنوعی همچنان در حال افزایش است؟

آنچه در میزها گفته میشود: فلاویو بولسونارو و اسکات بسنت به لوئیس کاپوتو کمک میکنند، اما بازار هزینه فعالیت را پرداخت میکند

شرکت سرمایهگذاری USV از جمعآوری ۹۰۰ میلیون دلار برای صندوق جدید خود خبر داد و بر سرمایهگذاری در زمینههای هوش مصنوعی و رباتیک تمرکز خواهد کرد

چرا بیشتر پروتکلهای DeFi در سال 2021 از بین رفتند؟

سهام و ارزهای دیجیتال مرتبط با هوش مصنوعی که سیترینی به آنها توجه کرده است... 8 شرکت ثبت شده و 1 ETF و 15 ارز دیجیتال

متخصصان درباره نیاز به آموزش مالی در عصر فینتک هشدار میدهند

استارتاپ هوش مصنوعی Manus پس از لغو خرید ۲ میلیارد دلاری متا توسط چین، ۵۰۰ میلیون دلار جذب کرد



