رقابت برای تسریع استنتاج AI در حال افزایش است. استارتاپ فرانسوی Kog به جای توسعه چیپهای خود، بر روی بهینهسازی نرمافزاری در سطح زیرساخت تمرکز کرده است تا توانایی استنتاج GPUهای موجود در مراکز داده شرکتها را بیشتر آزاد کند.
تمرکز بر روی سناریوهای با تأخیر بالا
این شرکت در ماه مه امسال به خاطر یک پیشنمایش فناوری مورد توجه قرار گرفت. Kog در آن زمان نشان داد که با استفاده از GPUهای استاندارد مراکز داده مانند AMD MI300X و Nvidia H200، میتوان سرعت بسیار بالایی در رمزگشایی درخواستهای تکی به دست آورد. این شرکت سپس اعلام کرد که این نمایش حدود 200 سرنخ تجاری مشخص به همراه داشته است.
Kog در حال حاضر بر روی جریانهای کاری حرفهای که نیاز به سرعت پاسخ بالا دارند، به ویژه در سناریوهای مهندسی نرمافزار تمرکز دارد. به گفته این شرکت، برخی از کاربران تولید کد سنگین ممکن است برای دریافت نتایج، ساعتها منتظر بمانند و تأخیر در استنتاج به یک مشکل مهم در تجربه کاربری و هزینه تبدیل شده است.
این شرکت همچنین در حال همکاری با برخی از شرکای طراحی برای پیشبرد کاربردهای عملی است. این نوع مشتریان به کاربران اجازه میدهند تا با استفاده از کلمات کلیدی، بازی یا برنامه تولید کنند و اگر سرعت استنتاج افزایش یابد، معمولاً به معنای کارایی بالاتر در تبدیل و فضای درآمدی بیشتر است.
مدلهای کوچک 3000 TPS را ثبت کردهاند
Kog پیشتر هدف «افزایش سرعت استنتاج مدلهای بزرگ به 30 برابر» را مطرح کرده بود، اما در حال حاضر نمایشهای عمومی عمدتاً بر اساس مدلهای کوچک است. نمایش آنها از مدل Laneformer 2B با حدود 2 میلیارد پارامتر استفاده میکند که سرعت استنتاج درخواست تکی به 3000 توکن در ثانیه میرسد. این مدل اکنون به صورت متنباز در دسترس است.
با این حال، تقاضای بازار به مدلهای کوچک محدود نمیشود. Kog اعلام کرد که مشتریان بالقوه تمایلی به تمرکز بر روی مدلهای کوچک ندارند، بنابراین این شرکت از زمان انتشار نمایش، عمده توجه خود را به توسعه تسریع مدلهای بزرگتر معطوف کرده است تا با نیازهای واقعی مطابقت داشته باشد.
تأیید توانایی مدلهای بزرگ در اواسط سپتامبر
Kog بر این باور است که پتانسیل GPU در رمزگشایی استنتاج هنوز به طور کامل آزاد نشده است. مدیر عامل این شرکت، Gaël Delalleau، اظهار داشت که با افزایش مداوم پهنای باند حافظه GPU نسل جدید، هنوز فضای زیادی برای بهینهسازی در سطح نرمافزار وجود دارد.
این روش هزینهای به همراه دارد که به طولانی شدن دوره تحقیق و توسعه منجر میشود. Kog اعلام کرد که برای هر سازگاری با یک GPU جدید، تیم معمولاً نیاز به چند هفته یا حتی چند ماه برای انجام تحقیقات در سطح سختافزار دارد. با توجه به اندازه فعلی تیم 11 نفره، تعداد چیپهایی که این شرکت میتواند در کوتاهمدت پشتیبانی کند، هنوز محدود است.
Kog برنامهریزی کرده است که این روش را به تدریج به فرآیند تحقیق و توسعه مبتنی بر هوش مصنوعی متصل کند تا از چیپها و مدلهای بیشتری پشتیبانی کند. در حال حاضر، نقطه کلیدیتر این است که ابتدا ثابت کند این مسیر میتواند در مدلهای بزرگ کار کند. Delalleau پیشبینی میکند که این شرکت در اواسط سپتامبر اولین مدل اصلی خود را با افزایش سرعت حدود 10 برابر به اتمام برساند و بر اساس آن پیشرفت مشتریان را به نمایش بگذارد و به دنبال تأمین مالی دور A بعدی باشد.
این محتوا صرفاً برای اطلاعرسانی عمومی ارائه شده است و بهمنزله مشاوره مالی، سرمایهگذاری، حقوقی یا مالیاتی تلقی نمیشود. هرگونه رویداد، جایزه، کمپین آنلاین یا اطلاعات مرتبط که در اینجا ذکر شده است، نباید بهعنوان توصیه، ترغیب یا دعوت به خرید، فروش، معامله یا هرگونه دادوستد دیگر داراییهای رمزارزی تلقی شود. داراییهای رمزارزی از نوسان بالایی برخوردار هستند و ممکن است منجر به زیان شوند. دسترسی به خدمات، محصولات و رویدادهای مرتبط با WEEX ممکن است بسته به منطقه جغرافیایی متفاوت باشد. اطمینان از اینکه استفاده شما از این خدمات با قوانین و مقررات محلی مطابقت دارد، بر عهده خود شماست.





























