实验闭环验证」共找到 2170 篇相关文章

算法论文8

ICSE 2026杰出论文 | 突破代码模型真实工程落地瓶颈,北大团队提出SEAlign对齐框架:显著提升软件工程智能体决策质量

现有代码模型在经典基准表现好,但在真实软件工程环境表现差。北大金芝、李戈团队提出 SEAlign 框架,通过识别与对齐智能体轨迹关键决策点,提升模型在真实工程任务表现,成果获 ICSE 2026 杰出论文奖。

机器之心
新闻资讯8

软件 3.0 时代来临

OpenAI 联合创始人 Karpathy 在 AI Ascent 2026 大会提出软件正经历第三次范式转移。从 Software 1.0 到 3.0,人类参与编程方式不断变化,3.0 用自然语言编程,中间层应用被模型原生能力吞噬。

AGI Hunt
推荐文章8

揭秘大模型Steering:从底层机理到系统评估,全面破解大模型行为控制之谜

近期《Science》研究表明可解析AI内部表征实现通用引导与监控。浙大联合阿里两篇ACL 2026主会论文,揭示Steering工作原理与能力边界,还开源一站式框架EasyEdit2,全面展示了Steering价值。

机器之心
算法论文8

CVPR Highlight|让无人机学会自己认路+锁位目标,国防科大给出一套新解法

国防科技大学 SAW Lab 团队联合多高校推出无人机实时地理定位系统「PiLoT」,首次仅靠单目 RGB 序列在 GNSS 拒止环境完成无人机及目标定位,性能达先进水平,成果被 CVPR 2026 接收。

机器之心
开源动态7

静态技能已死:cognee怎么让AI自己修自己的prompt

文章指出当前agent技能存在silent drift问题,Cognee作为开源知识引擎,将skills视为活的系统组件,通过Skill Ingestion、Observe、Inspect、Amend、Evaluate & Update五步实现自我进化,还介绍了相关应用及社区反应。

AI工程化
新闻资讯8

Claude Code 的创始人揭秘工作流程:开 5 个智能体“玩编程游戏”,不看的程序员就落后了?

Anthropic公司Claude Code创始人Boris Cherny在社交平台分享工作流程,引发行业关注。他并行运行5个Claude智能体编程,用最大最慢模型Opus 4.5,还解决AI“健忘症”,实现重复性任务自动化。

InfoQ
算法论文7

视觉优势还是语义依赖?揭秘 DeepSeek-OCR 高压缩率背后的真相

中科院等团队论文剖析 DeepSeek - OCR,通过实验揭示其高压缩率下准确率高或依赖语言先验。去掉语言先验,准确率暴跌;下游任务推理崩塌,长文本处理也有瓶颈。

深度学习自然语言处理
算法论文8

CJA | 中国航天气动院冯亦葳、许亮等:符号回归启发的可压缩流场结构智能识别:基于局部对流特征分布的统一理论框架

目前流场结构识别方法有局限,传统经验法依赖阈值,深度学习法可解释性与泛化能力不足。本研究从流体控制方程出发,用符号回归建立统一流场结构分类框架,能准确识别复杂流动结构。

力学与人工智能
推荐文章8

Anthropic 重新定义智能体终局: Bash Is All Agent Need!

Anthropic工程师Thariq Shihipar提出,最强大的Agent工具是Bash和文件系统,基于Unix思想构建Agent会超传统API工具。还介绍了上下文工程、Agent Loop本质等内容,认为这或是Agent终极形态。

探索AGI
算法论文8

SIGIR 2025 | 视频检索新范式!北邮、北大等联合提出AV-NAS:首个音视频哈希搜索架构,让Mamba与Transformer自动“组队”

北邮、北大等团队提出 AV-NAS,在多模态视频哈希领域引入 NAS,构建含 Transformer 与 Mamba 的统一搜索空间。该方法能自动发现最优跨模态融合机制,揭示音频时序建模中“CNN + FFN”结构更优,代码已开源。

AI前线