「顶会研究」共找到 3122 篇相关文章
【翻译】在 Codex 中使用 Goals:长时间工作的持久目标
文章介绍 Codex 中的 Goals,它是持久目标,能让线程跨多轮对话朝明确结果推进。阐述了 Goals 与普通 prompts 的区别、编写方法、活跃后的变化、设计方式及适用场景等,还通过案例展示其在研究任务中的应用。
总成本降低30倍,告别昂贵后训练,在线策略蒸馏敲开大模型后训练的未来
明星公司Thinking Machines由前OpenAI首席技术官联合创立,其研究团队提出在线策略蒸馏的LLM后训练方法。该方法结合在线策略训练与蒸馏优势,解决后训练两难困境,成本降30倍,还为持续学习和个性化打开新大门。
LLM 语境下,「持续学习」是否是 「记忆」 问题的最优解?
本期通讯解读 3 个 AI 业内要事,包括谷歌嵌套学习范式引争议、AI 产品记忆方向探讨、英伟达合成数据等。谷歌 NL 范式想规避遗忘问题,测试中 HOPE 表现优,但也遭质疑,当前 LLM 研究更关注改善记忆。
GPT-5超越人类医生!推理能力比专家高出24%,理解力强29%
最新研究显示,GPT - 5在医疗领域处理多模态信息能力出色,在多模态测试中推理和理解得分比GPT - 4o分别提高近30%和36%,比人类医生还高。其能力提升源于端到端多模态架构,但现实应用还需更多实战考验。
李曼玲、李飞飞、吴佳俊等联手:评估具身大模型的新范式!
全新的具身模型空间能力评估范式Theory of Space突破传统局限,考察模型在动态环境构建、修正和利用空间信念的能力。该论文被ICLR 2026接收,研究对前沿多模态大模型评测,揭示其空间认知能力边界。
「AI大模型时代的CIO」云栖专场: AI实战者与落地破局者的坦白局
云栖大会「AI大模型时代的CIO」专场,探讨企业AI落地难题。虽搭上AI电梯是趋势,但企业落地有不确定性,如组织架构不匹配等。多位实战者分享经验,给出RIDE等解法,助企业破局。
一句话,性能暴涨49%!马里兰MIT等力作:Prompt才是大模型终极武器
马里兰大学、MIT、斯坦福等机构研究发现,AI性能提升一半靠模型,一半靠提示词。他们让DALL - E 2和DALL - E 3 PK,发现DALL - E 3性能提升中,模型升级贡献51%,提示词优化贡献49%。
AI不靠“闭门造神”,海内外一线专家共探智能新纪元,GOSIM AI Paris 2025圆满收官!
5月7日,GOSIM AI Paris 2025在法国巴黎迎来第二日议程。全球专家围绕AI技术多方面探讨,涉及模型、基础设施等主题。还分享大模型趋势,宣布新型许可证,各分论坛展示多元成果,大会圆满收官,杭州场9月待启。
《动手写AI Agent》多模型适配:一套代码跑通三家 LLM
上一章用火山引擎豆包 API 写了能跑的 Agent,但换模型重写代码会混乱。本章用 Adapter 模式解决问题,介绍火山引擎、Claude、OpenAI 三家 API 关键差异,还分析了 Claude 工具调用格式特殊之处。
全靠Claude Code 10天赶工上线,Cowork 删用户11G文件不含糊!核心研发:长时间打磨再发布很难成功
Anthropic发布的Claude Cowork研究预览版问题频出,如删用户文件、窃取文件。与Claude Code对比,它交互繁琐、效率滞后。不过核心研发称快速上线再迭代,未来Agent类应用界面会趋简,Skills是关键。