能力显著向量」共找到 3714 篇相关文章

算法论文8

Auto Research时代,47个没有标准答案的任务成了Agent能力必测榜

Einsia AI旗下Navers lab发布Agent Benchmark——Frontier-Eng Bench,让AI在47个多学科交叉的硬核任务中做工程优化,测试其迭代优化能力。研究总结出AI进化规律,初步勾勒接近真实工程循环的AI系统。

量子位
算法论文8

dLLM的「Free Lunch」!浙大&蚂蚁利用中间结果显著提升扩散语言模型

近年来,扩散大语言模型(dLLM)成为文本生成新势力,生成效率高。但现有解码策略忽视中间迭代信息,研究团队观察到「先对后错」现象,提出 TCV 和 TCR 方法,显著提升模型在推理任务表现。

机器之心
算法论文8

Agentic Deep Research新范式,推理能力再突破,可信度增加,蚂蚁安全团队出品

尽管LLM能力提升,但在复杂任务上受静态内部知识限制。业界提出Agentic Deep Research系统,不过现存系统有梯度冲突和奖励稀疏问题。蚂蚁安全团队提出Atom - Searcher,解决上述问题,实验效果良好。

机器之心
推荐文章8

Python语言从2.7到3.14的能力变化与演进逻辑

文章从编程风格、类库生态、性能优化等多维度,阐述Python从2.7到3.14版本的能力变化与演进逻辑。如编程风格现现代化转型,类库生态战略性调整,性能优化有突破性进展等,还分析了演进背后的推动力及未来趋势。

阿里云开发者
算法论文8

LLM 仅靠自身就能增强推理?SePT 给出简洁在线自训练范式

多数推理后训练方法依赖外部信号,SePT仅用模型自身生成的答案自训练,能提升推理能力,数学推理任务准确率升10个点。它核心简洁,设计关键是温度解耦等,不损模型通用能力,代码易迁移复现。

机器之心
新闻资讯7

英伟达给黄仁勋儿女涨薪了!年薪百万美元,“凭能力而不是身份”

英伟达向美国SEC提交的2026财年委托投票说明书显示,黄仁勋女儿Madison、儿子Spencer的总薪酬分别达123.2万和132万美元。英伟达称两人薪资评定与黄仁勋无关,二人能力出色,一路晋升。

量子位
产品应用8

Nano-Banana 核心团队分享:文字渲染能力才是图像模型的关键指标

谷歌新发布的图像生成与编辑模型Gemini 2.5 Flash Image(Nano - Banana)热度超Grok视频生成。文章通过团队访谈,介绍其图像创作新方式、文字渲染代理指标、交错生成能力等,还对比了与Imagen差异,展望AI终极形态。

Founder Park
产品应用7

Deepseek 正式发布 V3.1:混合推理,Agent能力大幅提高,token消耗减半

Deepseek正式发布Deepseek V3.1,采用混合推理,支持双模式切换,上下文扩展到128k,API支持Claude Code调用。工具与Agent能力提升,思考效率更高,token消耗减半,官方渠道全面升级,9月6号起调整价格。

AI寒武纪
推荐文章8

AI 开发时代的“能力暴露与禁止空间”方法论:TPDD 与高层测试闭环

文章指出大模型加速软件开发范式演进,AI 深度介入开发带来新生产路径,但也放大风险。作者提出 TPDD 方法论,通过提前定义测试点与边界条件,平衡能力利用与风险控制,确保系统可控、安全、可持续。

InfoQ
产品应用7

姚顺雨Agent能力交卷!腾讯混元Hy3把元宝练成了打工人

腾讯混元Hy3正式版发布,总参数295B、激活参数21B,最大支持256K上下文。它是快慢思考融合的MoE模型,重点提升Coding和Agent能力。其加持下,元宝大升级,能完成办公、生活等多场景任务。

量子位