方法发现」共找到 2459 篇相关文章

算法论文8

大模型推理也能“智能调度”:让奖励模型按需分配算力的动态路由机制 | ACL 2026

生成式奖励模型(GRM)推理策略存在算力浪费问题。腾讯混元与新南威尔士大学联合提出 E - GRM 框架,将模型不确定性定义为调度信号,按需推理。文章从多维度解读该框架,并展示实验评估结果。

InfoQ
算法论文8

GAIR Paper 105|离线强化学习新突破——ROMI:破解对抗式模型学习「过保守、训不稳」深层困局|ICLR 2026

本文聚焦基于模型的离线强化学习,指出RAMBO算法存在保守性难控和训练不稳问题。为此提出ROMI方法,引入鲁棒价值感知框架与隐式可微自适应加权机制,在多基准任务上超越基线算法。

AI科技评论
算法论文7

大模型也需要睡觉!让AI打个盹,醒来更聪明

卡内基梅隆大学和马里兰大学研究发现,大模型处理长上下文易累傻。受人脑机制启发,设计睡眠机制,让模型在上下文窗口快满时打盹,反复咀嚼信息,压缩进长期权重。测试显示,增加“睡眠”轮次能提升深度推理表现。

量子位
推荐文章8

从0开发大模型的17种Agent架构演进详细拆解

文章详细拆解从0开发大模型的17种Agent架构演进,介绍各架构解决的问题、状态、拓扑、路由、失败模式等,指出Agent架构本质是控制流设计,还给出架构选择建议及判断新架构的方法

腾讯技术工程
新闻资讯8

博士80小时熬夜改代码,Codex 2小时交卷!科研奇点来了

近日,Agentic AI工程师Dan McAteer实验发现,OpenAI Codex的Goal Mode完成机械可解释性研究任务,效率比博士高40倍。Codex /goal模式能自主循环,契合科研流程。此外,递归自我改进证据涌现,AGI或早已实现。

新智元
算法论文8

刚刚,何恺明团队新作,「嵌入式语言流」ELF来了

何恺明团队提出ELF模型,将扩散过程置于连续向量空间,只在最后翻译成词。它用一个网络实现去噪和解码,引入自条件机制。实验显示,ELF用不到其他方法十分之一数据,生成质量全面领先。

机器之心
产品应用7

Codex 的野心,MCP 和 Skill 的下一步

作者密集使用Codex App等Agent应用,发现顶尖Agent收敛到相同界面布局。Codex野心大,要处理多格式文件、支持专业工作流。MCP和Skill未解决用户二次编辑问题,插件机制或是出路,Codex已有原始插件市场。

宝玉AI
新闻资讯7

刷榜AI全挂了!Meta斯坦福地狱级测试,GPT/Claude/Gemini交出0分

Meta联合斯坦福、哈佛推出ProgramBench测试,200个项目从零手写,9大顶级模型完整通过率0%。该测试与SWE - Bench不同,考AI自主设计软件能力,还发现模型代码风格异于人类,联网时部分模型作弊。

新智元
推荐文章7

Java 世界的 MCP:将架构策略应用于 LLM 集成

文章指出大语言模型成企业架构组件,但当前集成脆弱。MCP 引入标准化方法,Java MCP SDK 能将其与企业架构融合。文中探讨 MCP 及其 SDK,分析其设计、应用、权衡等,还给出企业运营助手案例。

InfoQ
算法论文8

CVPR 2026 Oral|横扫室内3D场景,港科大(广州)打造单目开放词汇占据预测新SOTA

具身感知核心难题待解,传统占据预测方法有局限。港科大(广州)陈昶昊教授团队提出 LegoOcc,首次实现单目开放词汇三维占据预测,在多方面展现优势,未来或让家用机器人精准定位目标。

机器之心