自演进评测」共找到 1866 篇相关文章

算法论文8

CVPR 2025 Highlight | 提升回归模型样例学习能力,Few-shot图像编辑新范式开源

当前图像编辑模型在处理新概念时泛化能力不足,为解决此难题,Meta等研究者提出回归模型InstaManip,创新性提出分组注意力机制和关系正则化策略,在few - shot图像编辑任务上取得优异效果。

机器之心
新闻资讯8

未来1-5年半数白领或失业?Anthropic联创曝:内部工程师已不写代码,下一代AI大多是Claude己写的

在2025年Axios AI+华盛顿峰会上,Anthropic联创接受访谈,称未来1到5年,多达一半白领工作或消失,失业率或飙升至20%。Anthropic内部工程师工作已巨变,Claude能写代码设计下一代AI。此外,AI还出现作弊等情况。

AI科技大本营
开源动态8

全球首个AI智能体「进化」开源框架来了!一次部署,终生可用

英国格拉斯哥大学团队发布全球首个AI智能体进化开源框架EvoAgentX,打破传统多智能体系统构建与优化限制。它有动化构建、进化机制和系统性评估亮点,实验验证其性能提升显著。

新智元
算法论文8

CVPR 2025 Highlight|北大联手智元发布首个基于说明书的家电操作评测基准

北大联合智元团队提出全新家电操作评测基准 CheckManual,被 CVPR 2025 接收并评为 Highlight。它有拟真说明书与多样资产、契合实际的评测任务、首个操作规划模型 ManualPlan 等优势,还做了相关实验。

机器之心
产品应用8

模型换个Harness就「变笨」?EverMind把进化从研究推向产品,让AI「越用越聪明」

同一模型换 Harness 表现或大幅波动,暴露进化走向产品的两个关键问题。EverMind 用 HarnessBank、Raven 与 EverMe 解决,将进化从研究推向产品,让 AI「越用越聪明」。

机器之心
算法论文8

对话清华商宇丨从生成视频到支撑行动,世界模型需要新的评测标准

文章围绕清华团队提出的 WorldArena 评测框架展开。它针对具身世界模型,对过去沿用视频生成的评测逻辑重新审视,从视觉质量和功能性任务两维度评估,推动世界模型从‘生成世界’迈向‘使用世界’。

AI科技评论
产品应用7

一家智能眼镜公司,为什么非要研AI大模型系统?|甲子光年

智能眼镜要么不够智能,要么不像眼镜,李未可科技CEO茹忆认为AI要成第一响应者。该公司推三款AI眼镜,搭载研系统。其研AI大模型系统,是为交付难复制AI体验闭环,解决通用API不足等问题。

甲子光年
新闻资讯7

OpenAI研芯片270天光速成功!谷歌TPU大将主导,老黄一夜大客户变对手

OpenAI发布研推理加速芯片Jalapeño,与博通和Celestica合作打造,专为大模型优化,9个月就流片。操刀者是前谷歌TPU核心成员Richard Ho,计划2026年底部署。此前谷歌、微软等已研芯片,英伟达客户变对手。

量子位
产品应用7

Harness Engineering实践,做了一个平台让AI一晚上评测和优化你的系统

作者分享搭建小平台实现全动化评测与系统优化的实践,包括创建评测任务、集、报告等,通过钉钉文档、绘报等案例展示操作,还能动优化系统,不过需系统UI规范、AI Coding含量高。

阿里云开发者
开源动态8

AI 真能看懂物理世界吗?FysicsWorld:填补全模态交互与物理感知评测的空白

多模态大语言模型正经历范式转变,目标是实现全模态协同交互。但现有评测体系难跟上模型发展。飞捷科思和复旦团队推出 FysicsWorld 基准,可评测模型多能力,还提出 CMCS 策略,为全模态智能发展提供指引。

机器之心