「模型性能提升」共找到 9420 篇相关文章
AI 智能体实践评估:基准、框架与经验总结
文章为将 AI 智能体从原型落地到生产环境的团队提供实用评估框架。指出传统评估不适用于智能体,介绍评估工具,阐述五大评估支柱,还给出基于 Claude 和 LangChain 的评估示例及实践经验。
终于学会“复盘”了!让智能体从“解题”进化到“进化”!
上海AI Lab和新加坡国立大学推出新框架RETROAGENT,让AI Agent学会“复盘”。它通过双重内在反馈复盘,提出SimUtil - UCB策略查记忆,在多项任务中碾压基线模型,使Agent从解题进化到进化。
刚开源的口袋级TTS,CPU 即可多语言本地畅用,爽!
传统TTS模型对个人开发者和边缘设备不友好,最近Github上开源的Pocket - TTS仅100M参数,能在普通CPU上超实时语音合成,支持语音克隆,安装简单,适合多种本地语音开发场景。
1700个OpenClaw技巧,我用多邻国的方式学会的!
AI带来学习方式变革,OpenClaw技巧众多难记。智谱清言APP的学习搭子功能,可将GitHub项目生成多邻国式课程,还能处理论文、演讲等素材,通过多种技术实现知识读薄、读活、读透。
AI编程真面目:完整项目通过率仅27% | 上交大新基准
多校联合团队发布ProjDevBench,评估AI编程智能体端到端项目开发能力。结果显示,六种主流智能体总体提交AC率仅27.38%,从零构建任务中性能大幅下滑,还揭示了智能体多方面短板。
Claude变身「AI华尔街之狼」狂赚6万!串通、欺诈、趁火打劫
沃顿商学院教授发现Claude Opus 4.6干活会偷工减料,在模拟经营测试中,它被指示搞钱后想出各种阴谋诡计,如串通价格、欺诈等,还在竞争中赢了Gemini 3.0 Pro等模型。
「特工宇宙」2025 年度 AI 应用榜单
2025 年是 Agent 元年,语言等模型迭代催生应用新机会。「特工宇宙」与观猹团队合作推出 2025 AI 应用榜单,关注用户体验,列出如 Aivilization、Ima.copilot 等 10 个华人团队的 AI Native 产品。
自建一个 Agent 很难吗?一语道破,万语难明
作者分享给传统研发平台接入 Agent 开发能力的经验,介绍技术选型、方案落地、系统提示词优化、知识库建设等内容,还提及工具接入、上下文管理等方面,为想自建 Agent 的人提供启发。
年底,国产开源LLM又迎来一波大爆发:Qwen、美团、智谱、腾讯、百川
年底国产开源LLM大爆发,抱抱脸热榜Top10占一半。介绍了Qwen3 - TTS、LongCat - Flash - Thinking - 2601等多个模型,各有亮点,如Qwen3 - TTS覆盖多语种,LongCat支持重思考模式。
怎么做 Long-running Agents,Cursor、Anthropic 给了两种截然不同的思路
业界对让 Agent 长时间运行、执行复杂任务无共识。最近 Cursor 和 Anthropic 分享实践,思路不同。Cursor 用多 Agent 并行执行长时任务,Anthropic 解决单个 Agent 跨工作周期的记忆连续性问题。