开源动态7
PRBench测AI:GPT - 5在金融法律领域得分低
新智元
AI 摘要
Scale AI团队推出PRBench基准,用于测试AI在金融和法律领域表现。顶尖大模型如GPT - 5得分低,揭示其处理重大经济后果任务不可靠,该基准助力开发更可靠AI系统。
阅读原文 · 新智元
GPT-5得分不到0.4!法律+金融最大规模基准:1.9万+专家评估准则
新推出的PRBench基准可测AI在金融和法律领域表现。它有19356条专家评估准则,是该领域最大公开基准。顶尖大模型在困难子集得分低,还独创经济路径分析维度,约30%任务为多轮对话,揭示了AI在专业领域的不足。

关注公众号
扫码关注
第一时间收到每日精选
相关文章
推荐文章8
TypeScript 之父:AI 杀不死老语言,初级工程师不会被取代
前 Meta 资深工程师 Ryan Peterman 对话 TypeScript 之父 Anders Hejlsberg,谈及 TypeScript 编译器从 JavaScript 移植到 Go 的考量,反驳‘AI 将写完所有代码’等论调,指出主流语言地位会因 AI 更巩固,初级工程师不会被取代。
AI科技大本营
产品应用8
祝毅晨团队发布世界仿真器CurrentWorld - 0
Current Robotics团队发布交互式世界仿真器CurrentWorld - 0,创始人祝毅晨履历亮眼。该仿真器能跨本体、多视角、力 - 触觉预测,可用于评测机器人,还能让人类接管以探索不同动作结果。
量子位
产品应用7
Cherry Studio:从Chat到Agent的产品重构
Cherry Studio最初是为用户在不同大模型间切换的聊天客户端,随行业从Chat转向Agent,它开启2.0版本重构,定位转向「个人Agent平台」,底层架构重写,要解决产品复杂性、完善协作等问题。
Founder Park
新闻资讯7
InfoQ:AI 重写工程师角色,一切仍关乎人
InfoQ 2026 年趋势报告探讨了 AI 对软件开发的影响,包括重写工程师角色、团队演变等。嘉宾指出 AI 采用应结合风险和业务场景,巩固基础,重新设计审查流程,关注质量和人的因素。
InfoQ