「评分标尺」共找到 83 篇相关文章
刚刚,加入腾讯的姚顺雨发表首篇Paper~
腾讯混元与复旦联合发表论文《CL-bench》,姚顺雨署名并全面细致审阅反馈。CL-BENCH 首次单独考‘现学现卖’,有独特设计原则、四大题型,其评分杜绝‘差不多’,还让 10 个前沿模型‘翻车’。
刚刚,马斯克开源基于 Grok 的 X 推荐算法!专家:ROI 过低,其它平台不一定跟
马斯克时隔近三年再次开源X推荐算法,该算法基于Grok,采用端到端学习预测用户兴趣。不过有争议认为这或是因现实压力。专家称其ROI低,其他平台不一定跟进,且此次开源对学术研究价值不大。
和知乎一起,推出了个 AI 先行者榜单
知乎发起AI先行者榜单评选,与作者合作。提名公开透明,来自社区征集。评选从多维度评估,综合各方评分推出首期榜单。活动非一次性,后续每季度都有,鼓励更多人参与。
重新认识具身行业,从自变量的这封邀请函开始
具身智能行业存在评分、技能、样品、商业四大‘气泡’,即认知偏差。自变量机器人将在发布会上戳破‘气泡’,打破认知差,重建评价标准。行业‘拐点时刻’需大脑能力突破、真实场景稳定运行、跑通ROI闭环。
Artificial Analysis 榜单第二,SkyReels-V4 宣告 AI 视频进入「全栈统一」阶段
昆仑天工的 SkyReels-V4 在 Artificial Analysis 文生视频榜单排第二,ELO 评分 1090。它有「运动参考」能力,能覆盖视频创作全工作流,背后靠统一拼接框架和双流 MMDiT 架构,体现 AI 行业「统一」趋势。
OpenAI 开发者的 Skill 经验:如何使用评估系统来优化 Skill
文章聚焦 OpenAI 开发者优化 Skill 的方法,指出迭代 AI 技能效果难测,可借助评估系统。介绍了用 Codex 评估的流程,包括明确标准、创建技能、手动触发找漏洞等,还提及不同阶段的评估重点和工具。
OpenAI这招太狠!AI从「躲猫猫」到「自爆黑料」,主打一个坦白
随着AI进入高风险场景,透明、安全变得重要。OpenAI提出「忏悔机制」,让模型回答后产出自我坦白报告,不影响主回答评分,只考察诚实,能提升不良行为可见性,目前仍处概念验证阶段。
具身智能的时代命题,上海如何破题?
本文指出具身智能是AI新标尺,人形机器人是其前沿复杂载体。中国在AI领域发展迅速,在学术、人才、制造等方面优势明显。上海具身智能产业优势突出,正推动其走向实用。
Runway Gen-4.5刷屏发布,把重量、尘土和光影都做对了,网友:颠覆
Runway Gen-4.5突袭发布,获“视频生成AGI时刻”评价,在Artificial Analysis测试中拿下SOTA。它能精准执行复杂指令,物理还原与视觉精准度强,官方将逐步开放使用权限,还直言其存在因果推理等局限。
谁是最强“打工AI”?OpenAI亲自测试,结果第一不是自己
OpenAI发布新研究,提出GDPval基准衡量AI模型在有经济价值任务上的表现。Claude Opus 4.1表现最佳,GPT - 5次之。OpenAI开源优质子集并提供自动评分服务,还指出了GDPval的局限。