自动化评测」共找到 1070 篇相关文章

算法论文8

长程任务飙升98%,斯坦福Skill原生LLM来了

普林斯顿、CMU、斯坦福、牛津等提出Skill-Native大模型,提出Skill Entropy度量技能切换难度,搭建Skill²-Bench评测,还将熵用作训练信号提出Skill-Entropy RL,提升多模型准确率,且技能熵可复用。

PaperAgent
开源动态8

真可用!美团数字人模型开源,MV、电商等统统拿下

美团开源数字人视频生成框架 LongCat - Video - Avatar 1.5 版本,换音频编码器、加速推理,支持多任务与多场景。经770人评测,它在多维度领先对手,各方面表现均衡,效率与质量兼得。

AIGC开放社区
算法论文7

1美元Token撬动4800美元收益!AI挑战百万美元级基准,最赚钱的Agent出现了

Humanlaya Data Lab等机构构建$OneMillion - Bench评测基准,用经济价值衡量模型。它含400道高难题目,覆盖多领域。目前最强模型能产出约50万美元价值,但离可交付专业任务还有距离。

机器之心
算法论文8

从代码基座模型到智能体与应用:代码智能的全面综述与实践指南

北航、阿里等机构联合发布论文,系统梳理 2021 - 2025 年代码大模型发展。介绍代码基座模型、评测任务、对齐技术等,还提及软件工程智能体、安全防御及训练指南,预言未来编程走向。

深度学习自然语言处理
新闻资讯8

李飞飞押注的3D世界模型黑科技,被这篇论文一次性扒光!

李飞飞创业公司World Labs发布空间智能模型成果,推出Marble平台。本文分享3D、4D世界模型技术综述,系统梳理原生表示的世界模型,给出分层分类法、数据集与评测指标,并开源维护。

PaperAgent
开源动态8

百川开源医疗增强大模型 Baichuan-M2:更符合中国临床诊疗场景,可 4090 单卡部署

百川智能发布并开源医疗增强大模型 Baichuan-M2,以更小尺寸反超 OpenAI 新模型。它可 4090 单卡部署,成本低,在 HealthBench 评测表现佳,免费开源,更适配中国临床诊疗场景。

InfoQ
新闻资讯7

卷赢OpenAI也没用!Salesforce用100万次对话揭秘:AI Agent最大的坑,根本不是技术!

Salesforce处理超100万次AI Agent与客户对话后复盘,指出行业追求“全自动化”是陷阱。AI Agent不仅要融合非结构化和结构化数据,还需提升人工介入率,遵循“同理心优先”原则。

探索AGI
新闻资讯7

再见,程序员!马斯克宣判:奇点就在2026

马斯克断言2026年是奇点之年,起因是Claude Code强大的编程能力引发关注。Claude Opus 4.5表现优异,碾压其他模型。奇点来临,人们工作方式将改变,AI或使软件开发自动化

新智元
算法论文8

通义团队提出环境Scaling:自动构建环境,并自主学习和成长,可让30B比肩1T效果

阿里巴巴通义实验室团队论文提出通过程序化、自动化构建模拟环境,让语言模型自主交互学习。基于此训练的AgentScaler模型,数十亿参数就达万亿级模型性能,为轻量级代理智能发展带来新可能。

深度学习自然语言处理
开源动态7

GPT-5认为这个模型是开源界的Claude 3.5——陈天桥朋友圈里的 MiroMind ODR 让我眼前一亮

陈天桥用GPT - 5评测自家开源模型MiroMind ODR,让其应对复杂问题。GPT - 5评价该模型是“开源界的Claude 3.5”,其能力让GPT - 5“点赞”,有闭源模型稳定性和可用性,还具全开放架构。

AI科技评论