开源动态8
红杉中国首发xbench评测工具
新智元
AI 摘要
红杉中国推出xbench:用双轨评估和长青机制,追踪模型理论上限与实际价值。首期有两评估集并排名,还构建垂类评测框架,解决现有评估难题,推动AI评估发展。
阅读原文 · 新智元
红杉中国xbench全球首发,AI智能体真实战力揭榜!
红杉中国推出全新AI基准测试工具xbench及相关论文,采用双轨评估体系和长青评估机制,首期发布两个核心评估集并综合排名,还提出垂类评测方法论。它能追踪模型能力与实际场景价值,解决现有评估难题。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
产品应用8
DeepSeek-V4-Pro正式版发布,Agent能力跃升
8月13日晚,DeepSeek-V4-Pro-0813正式版发布。此次升级将Agent维度提升至无短板的第一梯队,具备1M+384K长任务能力,接口双兼容,技术创新多。还公布评测对比、价格并发设定,给出实战代码案例与启示。
机器学习AI算法工程
新闻资讯8
林俊旸携新公司押注Agent赛道
前阿里Qwen负责人林俊旸创办Pragmatik Labs/语用科技,研究跨数字与物理世界的下一代agent。红杉中国、高榕创投领投,腾讯等跟投。其目标是用agent实现终极生产力,有独特技术底色与愿景。
PaperAgent
开源动态7
红杉发布 AgentIF - OneDay 评测体系
红杉中国 xbench 发布 AgentIF - OneDay 评测体系,用于评估大模型解决复杂任务的能力。该体系从任务复杂度新视角出发,沿 Scaling Context 和 Scaling Domain 推进,构造了三类典型任务进行测评,揭示了主流 Agent 的能力边界。
特工宇宙
新闻资讯7
红杉中国:推Agent测评工具Xbench
红杉中国团队提出AI基准测试工具Xbench,其双轨测评体系不再单纯执着于测评问题难度,重点量化AI系统在真实场景的效用价值,还构建长青评估机制,以确保评估结果的时效性和相关性。
机器之心