Tencent hat die Leistung seines eigenen CodeBuddy Codes und des Claude Codes mit dem selbst entwickelten Agenten-Benchmark WorkBuddy Bench getestet. 260 echte Arbeitsaufgaben wurden in die Kategorien Code, Web, Büro und Sicherheit unterteilt, und 7 Modelle wurden unter zwei verschiedenen Harnesses getestet. Die Ergebnisse zeigen, dass Claude Code in 28 Gruppen von Modellvergleichen 17 Gruppen gewonnen hat, während CodeBuddy nur 11 Gruppen gewonnen hat. Besonders in der Kategorie Code hat Claude Code mit 7:0 klar gewonnen, und alle 7 Modelle erzielten nach dem Wechsel zu Claude Code eine Punktesteigerung. Obwohl CodeBuddy in den Kategorien Web und Büro mit 4:3 knapp gewonnen hat, wurde es in der Kategorie Sicherheit von Claude Code mit 4:3 geschlagen. Die Testergebnisse zeigen, dass bereits der Wechsel des Harnesses zu Punktunterschieden von mehreren Punkten führen kann, weshalb die Bewertung der Stärke von Agenten nicht nur auf dem zugrunde liegenden Modell basieren kann. Allerdings weist die Rangliste von Tencent auch Schwächen auf, da jede Kategorie nur 50 bis 80 Aufgaben umfasst. Die Community äußert Bedenken, dass die Erhöhung der Schwierigkeit die Rangfolge verändern könnte, und die Tests verwendeten nur zwei Harnesses, ohne Codex einzubeziehen.
Dieser Inhalt wird nur zu allgemeinen Informationszwecken bereitgestellt und stellt keine finanzielle, Anlage-, Rechts- oder Steuerberatung dar. Alle erwähnten Ereignisse, Prämien, Online-Aktionen oder zugehörige Informationen sollten nicht als Empfehlung, Aufforderung oder Einladung zum Kauf, Verkauf, Handel oder anderweitigem Umgang mit Krypto-Assets betrachtet werden. Krypto-Assets sind sehr volatil und können zu Verlusten führen. Die Verfügbarkeit von WEEX Services, Produkten und zugehörigen Aktionen kann je nach Region unterschiedlich sein. Sie sind dafür verantwortlich sicherzustellen, dass Ihre Teilnahme mit geltenden lokalen Gesetzen und Vorschriften übereinstimmt.





























