论文新颖性评估」共找到 1642 篇相关文章

产品应用7

Nano banana手办玩法火爆出圈!无需抽卡,效果惊了(°o°)

小某书被AI手办图刷屏,原来是谷歌的nano - banana(Gemini 2.5 Flash Image)模型爆火。文章实测其手办玩法,还介绍多种玩法,团队透露以文本渲染评估、原生多模态等核心技术,谷歌未来想整合模态实现AGI,还将举办黑客松。

量子位
开源动态7

Karpathy刚开源的autoresearch,我拿来优化龙虾skill,成功率从56%飙到92%

Karpathy发布开源项目autoresearch,可让AI优化AI。作者分享用其优化skill的实践,介绍优化流程,指出可将模糊表述拆成可判断是非题,还提及定义评估标准的方法与常见错误修正。此外,还能用于代码性能优化。

探索AGI
算法论文8

超越对数似然:模型能力连续体下的监督微调新范式

论文挑战监督微调(SFT)用负对数似然(NLL)作训练目标的默认设定,提出基于概率的目标家族,引入“模型能力连续体”概念,分析不同目标在不同模型能力下的表现,为模型后训练提供新优化方向。

深度学习自然语言处理
算法论文8

北大2篇Skill炸场,Agent彻底进化

北京大学连发两篇论文,给出让 Agent 变强的答案:让 Skill 自己进化。`SESA` 针对工具增强的搜索问答,用四个阶段闭环使任务生成和技能记忆一起进化;`VeriSkill` 把验证器废信号变成可信更新,二者场景不同但核心一致。

PaperAgent
算法论文7

视觉+语言+动作!超强具身“训练宝典” EmbRACE-3K

视觉 - 语言模型在具身环境中表现有局限,港大推出 EmbRACE - 3K 数据集应对。它含 3000 多个任务、2.6 万个决策步骤,有细致多模态注释。团队用其微调 Qwen2.5 - VL - 7B 模型,还建立新基准评估多个模型。

带你学AI
新闻资讯8

ICML 2026前瞻:投稿翻倍背后,机器学习正在换挡

第43届国际机器学习大会(ICML 2026)7月6 - 11日将在韩国首尔举行,主题为‘Machine Learning for the Real World’。今年投稿量翻倍,接收率26.6%,还做了两项制度调整。论文反映出LLM推理、AI安全、模型压缩等趋势,中国研究者表现亮眼。

AI科技评论
开源动态8

DeepSeek Harness背后的“心脏”:Cordis 到底是什么

文章介绍Cordis框架,它原服务第三方QQ机器人,现是DeepSeek Harness心脏。阐述其设计初衷、核心机制,如插件、上下文等概念,还提及在DSH中的应用,展示了插件槽位和生态,最后介绍相关论文和该框架的生态情况。

腾讯技术工程
开源动态8

o3 Gemini 都翻车?首个可验证长链 GUI 数据集 VeriGUI 重磅开源,探索通用 Agent 能力边界

GUI 智能体发展遇瓶颈,现有数据集难评估其长时程规划能力。2077AI 开源基金会牵头构建的 VeriGUI 应运而生,有长链复杂性与子任务级可验证性特征,论文登 Hugging Face 月榜第三,还证明现有模型瓶颈。

AI科技评论
算法论文8

RL在Agentic Reasoning中的作用:拨开迷雾,看清本质

近年大语言模型在推理任务能力惊人,但使用外部工具存挑战。传统SFT无法让模型自主调用工具,强化学习虽被引入,但在智能体推理中面临训练效率、稳定性和泛化能力难题。论文从多维度解构智能体强化学习,提出有效方法。

深度学习自然语言处理
算法论文8

破解AI对不同上下⽂位置的敏感度不⼀致,新框架使出“解铃还须系铃人”

语言模型存在位置偏见,影响复杂推理等任务。论文提出Pos2Distill框架,将模型优势位置能力迁移到劣势位置缓解偏差,设计了Pos2Distill - R1和Pos2Distill - R2,在检索和推理任务表现好且有跨任务泛化能力。

量子位