评估范式」共找到 1651 篇相关文章

算法论文8

YC总裁转发、登顶Hacker News:SkillsBench揭开Agent技能扩展的残酷真相

近日论文《SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Tasks》引发海外AI社区关注。研究聚合47150个Skills,经严格筛选评估,揭示人工构建Skills效果好、AI自生成无效等核心发现,为AI研发指明路径。

机器之心
开源动态7

AI用3年时光,来了解你!首个AI Clone长期记忆基准

现有AI记忆评测存在数据源单一、忽视变化本质、注入成本高等局限。开源学术社区QuantaAlpha联合高校团队提出CloneMem基准测试,构建合成人生,设计评测任务,实验发现简单方法在检索上更有效,记忆系统应还原信息。

新智元
新闻资讯7

最新 Anthropic 人类经济指数报告:AI 如何重塑经济?

Anthropic 持续监测 AI 实际使用情况,在第四份报告提出「经济基本要素」概念,分析2025年11月对话样本,探讨AI提效、任务时长、不同国家应用差异等,还评估职业受影响情况及对经济的总体影响。

特工宇宙
算法论文7

腾讯LLM团队:对下一个 Token 预测的深入剖析,多样性 or 精准度?

最新研究证实RL能增强LLM推理,但成效受限预训练token分布。腾讯LLM部把交叉熵重写成单步策略梯度,用超参压熵,为RL打造‘低熵高信号’起点,经实验验证低熵模型优势明显。

PaperAgent
产品应用7

SDD 如何在复杂业务系统中真正落地?

文章围绕SDD在复杂业务系统落地展开,介绍OpenSpec库使用,对比与系分差异,分析其优势与问题,如LLM与IDE执行能力鸿沟、无update命令等,还对比OpenSpec和GitHub Spec Kit,并给出流程及提示词。

阿里云开发者
算法论文8

硅基大脑记忆觉醒!会遗忘、会反思、会成长的AI正在到来

哈尔滨工业大学等机构团队发表研究,用认知神经科学视角审视AI记忆系统,探讨如何让AI产生“自我”,构建会遗忘、反思、成长的记忆大脑,还涉及记忆分类、存储、管理、评估、防御及未来演进等内容。

AIGC开放社区
算法论文8

从过拟合到通用!ViMoGen开启3D人体动作生成新纪元

随着AIGC爆发,3D人体动作生成领域滞后,现有模型泛化能力有瓶颈。南洋理工大学等机构研究人员提出ViMoGen,从数据、模型、评估三方面重新定义通用动作生成路径,还能赋能具身智能。

机器之心
新闻资讯7

银杏谷资本陈向明:用“科技第一性原理”看未来|甲子引力

2025甲子引力年终盛典上,银杏谷资本陈向明分享科技投资见解。他指出投资底层逻辑已变,应建立新范式,用“后视镜”“望远镜”“放大镜”做决策,还强调构建投资“生态”,从学科发展找确定性。

甲子光年
算法论文8

清华朱军团队Nature Machine Intelligence:多模态扩散模型实现心血管信号实时全面监测

清华朱军等团队提出多模态生成框架 UniCardio,在单扩散模型中实现心血管信号去噪、插补与跨模态生成。它采用扩散模型和 Transformer 架构,结合持续学习范式,实验表现优,有望用于多领域。

机器之心
新闻资讯7

当AI走进Second Half:真正的问题、价值与生态是什么?|甲子光年

本文是甲子光年年终盛典巅峰对话实录,探讨AI下半场问题。嘉宾们认为技术上未到下半场,但应用层面已至。大家围绕重新定义问题、评估真实价值、重构产业生态展开交流,分享见解与经验。

甲子光年