Tencent провела тестирование своего собственного Agent Benchmark WorkBuddy Bench, чтобы оценить производительность CodeBuddy Code и Claude Code. 260 реальных рабочих задач были разделены на четыре категории: кодирование, веб, офис и безопасность, и 7 моделей были протестированы в двух Harness. Результаты показали, что Claude Code выиграл в 17 из 28 групп сравнений с одинаковыми моделями, в то время как CodeBuddy выиграл только в 11 группах. Особенно в категории кодирования Claude Code одержал победу с результатом 7:0, все 7 моделей показали улучшение результатов после перехода на Claude Code. Хотя CodeBuddy одержал небольшую победу в веб и офисных задачах с результатом 4:3, в категории безопасности Claude Code выиграл с тем же счетом 4:3. Результаты тестирования показывают, что даже простая замена Harness может привести к разнице в десятки баллов, поэтому оценка силы Agent не может основываться только на базовых моделях. Однако в рейтинге Tencent также есть недостатки: в каждой категории задач всего 50-80 вопросов, и сообщество выражает сомнения, что добавление сложных задач изменит рейтинг, а тестирование проводилось только с двумя Harness, без учета Codex.
Этот контент предоставляется исключительно в общих информационных целях и не является финансовым, инвестиционным, юридическим или налоговым советом. Любые мероприятия, вознаграждения, онлайн-акции или связанная с ними информация, упомянутые в настоящем документе, не должны рассматриваться как рекомендация, приглашение к покупке, продаже, торговле или иной сделке с какими-либо криптоактивами. Криптоактивы очень волатильны и могут привести к убыткам. Доступность услуг, продуктов WEEX и связанных с ними событий может варьироваться в зависимости от региона. Вы несете ответственность за обеспечение того, чтобы ваше участие соответствовало применимым местным законам и нормативным актам.





























![TradingView интегрирует данные рынка Hyperliquid и Trade[XYZ]](/public-static/17_6433af618d.png?format=avif)