效果提升」共找到 3507 篇相关文章

产品应用7

仅用10天?Anthropic最新智能体Cowork的代码竟然都是Claude写的

Anthropic发布智能体工具Cowork,仅耗时一周半,其代码由Claude Code所写。它是Claude Code简化版,向特定用户开放,有多种功能。有用户称效率提升巨大,也引发创业圈震动,部分类似产品开源。

机器之心
推荐文章7

技多不压身,那龙虾的 Skill 是越多越好吗?

作者结合学术研究和自身经验探讨小龙虾装Skill问题。研究表明Skill并非越多越好,装多效果变差,还给出合适数量区间。同时分享用好Skill的经验,如按需安装、合理增减拆分等。

特工宇宙
算法论文8

在「想象」中练就真机能力:RISE,让VLA强化学习告别真机试错

香港大学李弘扬老师团队提出 RISE 框架,通过组合式世界模型让机器人在虚拟空间强化学习,解决传统 VLA 模型落地难题,在长程任务中性能提升显著,重新定义智能体理解世界的方式。

机器之心
算法论文8

Kimi新论文太硬核了!马斯克和Karpathy相继点赞~

马斯克和Karpathy点赞Kimi新论文《Attention Residuals》。该论文由杨植麟带队、苏剑林等参与,提出注意力残差(AttnRes),解决深层网络信息稀释问题,还通过工程折中降低成本,实验效果良好。

PaperAgent
算法论文7

Paper2Video:学术研究论文讲解视频自动生成

学术演示视频制作耗力,Show Lab提出Paper2Video基准数据集和PaperTalker多智能体框架,可从学术论文自动生成演示视频。还引入定制化评价指标,衡量学术演示视频效果

带你学AI
算法论文7

正确答案 ≠ 正确推理,CoT 或成大模型推理能力停滞的「罪魁祸首」?

研究指出当前大模型推理能力评估多关注答案准确性,忽视推理步骤。通过对前沿模型测试发现,2023 - 2024 年大模型推理能力提升停滞,进步靠提示工程,自底向上策略最有效。

AI科技评论
产品应用8

你的 Harness 工作流真的在进步吗?我们用一场考试撕掉了遮羞布

文章指出Harness工作流常靠‘主观vibes’驱动,缺乏有效评价体系。为此推出Harness Eval评测系统,包含出题、答题、改卷等环节,形成闭环,帮助工作流持续改进,还能提升整体通过率。

腾讯技术工程
推荐文章7

给AI全局记忆

作者认同OpenAI‘全局记忆’观点,称其能提升对话连贯性,实现AI成个人助理愿景。介绍OpenMemory项目可存储调用记忆,还提及实现功能的三点做法,看好创业者在该领域机会。

newtype AI
算法论文8

刷榜只是体力活!清华消费10万块,一周「肝」出105个SOTA

AutoSOTA通过多智能体协作,将AI研究中繁琐的性能优化过程自动化,使科研从「手工艺」转向「工业流水线」。在一周压力测试中,消耗约10.4万美元,发现105个SOTA模型,平均性能提升近10%。

新智元
开源动态7

走出 MMLU 的高分幻觉:AI Agent 的「斯坦利时刻」与职场生存法则

文章指出多模态大模型在基准测试分数高,在实际业务流程却像‘职场巨婴’。研究团队构建Trainee - Bench测试顶尖模型,结果显示模型离‘独立上岗’远,凸显提升Agent自主学习性的重要性。

AI科技评论