跳到正文
原文
Tessl· Simon Maple·· 2026-05-29精选AI 评分66

Tessl 评测显示 Claude Opus 4.8 在 skill evals 中以 95% 登顶 LLM 排行榜

Opus 4.8 tops the LLM leaderboard with 95% on skill evals

AI 导读

Tessl 将 Claude Opus 4.8 加入持续进行的模型基准测试,它在带 skill context 的评测中得分 95%,超过 Opus 4.7 1.6 分,超过 Cursor Composer 2.5 Fast 2.3 分。

推荐理由

原文同时给出准确率、baseline、评审一致性和耗时,便于比较高准确率与低吞吐之间的取舍。

来源:Tessl · tessl.io