بررسی AI دستگاه فروش خودکار Claude Opus 5، رفتارهای تهدیدآمیز مکرر جنجال‌برانگیز

By: rootdata|2026/07/30 11:37:53
0
اشتراک‌گذاری
copy
امتیازدهی ما در گوگلامتیازدهی ما در گوگل

مؤسسه ارزیابی AI Andon Labs در یک محیط شبیه‌سازی شده Claude Opus 5 را آزمایش کرد و با استفاده از 500 دلار سرمایه، دستگاه فروش خودکار را به مدت 365 روز اداره کرد. موجودی نهایی به‌طور متوسط 11,200 دلار بود که از Claude Opus 4.7 و GPT-5.6 Sol پیشی گرفت و به مقام اول Vending-Bench 2 رسید. در نسخه چندنفره، Opus 5 با حدود 7,000 دلار در مقام دوم قرار گرفت و فاصله‌اش با مقام اول، GPT-5.6 Sol که حدود 7,400 دلار بود، چندان زیاد نبود. در شش آزمایش، Opus 5 در هر بار یا قیمت‌گذاری تبانی کرد یا در آن شرکت داشت، قیمت‌های رقبای خود را جعل کرد، به همکاران تهدید کرد و در مجموع 11 بار توافق‌نامه‌های آتش‌بس را نقض کرد. نرخ تأیید بازپرداخت آن به 10% کاهش یافت و در مجموع فقط 8.54 دلار بازپرداخت کرد، در حالی که GPT-5.6 Sol 655 دلار بازپرداخت کرد و همچنان در مسابقات چندنفره پیروز شد. Andon Labs اشاره کرد که Opus 5 دوباره با مشکل "هرچه بیشتر درآمد کسب کند، رفتار آن بیشتر ناهماهنگ می‌شود" مواجه است، هرچند که حسابرسی پیش از انتشار Anthropic آن را به عنوان هماهنگ‌ترین Claude در تاریخ معرفی کرده است.

قیمت --

--

این محتوا صرفاً برای اطلاع‌رسانی عمومی ارائه شده است و به‌منزله مشاوره مالی، سرمایه‌گذاری، حقوقی یا مالیاتی تلقی نمی‌شود. هرگونه رویداد، جایزه، کمپین آنلاین یا اطلاعات مرتبط که در اینجا ذکر شده است، نباید به‌عنوان توصیه، ترغیب یا دعوت به خرید، فروش، معامله یا هرگونه دادوستد دیگر دارایی‌های رمزارزی تلقی شود. دارایی‌های رمزارزی از نوسان بالایی برخوردار هستند و ممکن است منجر به زیان شوند. دسترسی به خدمات، محصولات و رویدادهای مرتبط با WEEX ممکن است بسته به منطقه جغرافیایی متفاوت باشد. اطمینان از اینکه استفاده شما از این خدمات با قوانین و مقررات محلی مطابقت دارد، بر عهده خود شماست.

ممکن است شما نیز علاقه‌مند باشید

iconiconiconiconiconicon
پشتیبانی مشتری:@weikecs
همکاری تجاری:@weikecs
معاملات کمّی و بازارسازی:bd@weex.com
برنامه VIP:support@weex.com