「研究Agent」共找到 4382 篇相关文章
Evaluation is All You Need:评估设计的微小差异如何扭曲结果
论文以DeepSeek - R1 - Distill系列模型为例,指出大模型评估中看似客观的基准测试结果对评估细节极度敏感,细微评估条件变化会致分数波动大,削弱模型对比可信度,呼吁建立新评估标准。
Ilya 最新演讲:AI 将递归构建更强大的自己
Ilya Sutskever在演讲中称AI将递归构建更强大的自己,走向递归自我改进道路。他分享个人经历,还指出大型神经网络功能强大,AI发展不可预测,相关问题暂无答案。
所有AI工具共享持久私有记忆,OpenMemory MCP杀疯了~
本文介绍实用的MCP Server - OpenMemory MCP,它能为AI提供持久记忆、跨平台和跨会话功能,数据私有,隐私有保障。还演示了本地化部署步骤,且官方封装成MCP降低了使用门槛。
AI大佬教你如何中顶会:写论文也要关注「叙事」
NeurIPS投稿截止不到一月,Google DeepMind的Neel Nanda发布机器学习论文撰写指南,旨在解决论文表达晦涩问题。指南涵盖理想论文精髓、写作关键要素、结构解析、流程建议及常见问题应对策略。
突发!Opus 5.2深夜上线,RSI真来了?
Anthropic在Claude Code开启Claude Opus 5.2灰度测试,跳开5.1版本,解决了以往AI“偷懒病”,响应速度、输出质量大幅提升,同时曝光内部已用核武级Model 2编写代码,RSI或已来临。
余家辉交卷!Meta MSL连发图像/视频模型
Meta MSL由余家辉带队发布图像模型Muse Image,开启视频模型Muse Video预览。Muse Image表现出色,采用独特创作流程,能与Muse Spark联动,有多种实用功能;Muse Video待改进,将未来几月推出。
全球第一位AI哲学家,在谷歌DeepMind的9年:为AGI安全奔走
谷歌DeepMind的政治哲学家Iason Gabriel入职9年,发明的对齐框架影响Gemini训练决策。在AGI承诺与AI现实伤害间,他追问AI伦理。但技术部署快,6700亿美元涌入赛道,伦理红线被踩。
openJiuwen社区开源新招:重磅发布JiuwenSwarm,拉开群体智能“养蜂”序幕
openJiuwen社区开源蜂群智能体JiuwenSwarm,落地Coordination Engineering范式。它有全栈技术体系,支持人以HOTS和HITS模式参与协同,实战效果佳,且在评测中表现亮眼,全套能力开源。
李开复陆奇重仓同一家Harness智能体公司,李笛带队,4个月2轮融资3-5年粮草
成立仅四个多月的AI初创公司明日新程宣布连续完成两轮融资,资金储备够未来三到五年创新。其由李笛带队,获李开复、陆奇等投资,聚焦Harness群体多智能体,还将推出新版“小冰岛”。
对抗KV Cache压缩的脆弱性:两行代码以最坏风险控制防御底层假设崩塌
中科大团队在 ICLR 2026 论文中指出 KV Cache 压缩领域底层假设存在缺陷,主流方法基于的稳定性假设在真实场景中脆弱。团队提出防御性聚合策略,仅两行代码修改,显著提升 KV Cache 压缩性能。