软件工程任务」共找到 2062 篇相关文章

算法论文8

AI在线强化学习“边做边学”,斯坦福团队让7B小模型性能飙升,甚至超越GPT-4o

斯坦福等团队提出新范式AgentFlow,由四个智能体组成,用在线强化学习持续提升智能体系统推理能力。以Qwen - 2.5 - 7B - Instruct为基座模型的它在多基准测试表现突出,甚至超越GPT - 4o等大模型。

量子位
开源动态7

最强DeepResearch!通义DeepResearch-30B开源实战:模型部署+LangGraph+A2A全攻略

阿里发布全开源项目通义DeepResearch,在研究任务评测中表现出色,底层是30B的MoE专用推理模型,资源需求低。文章演示了基于该项目构建本地化端到端DeepResearch助理的方法,包括模型部署、Agent实现等。

AI大模型应用实践
开源动态8

蚂蚁开源万亿参数思考模型 Ring-1T,综合能力逼近 GPT-5、数学能力对标 IMO 银牌

10月14日凌晨,蚂蚁集团推出万亿参数思考模型Ring-1T并全面开源。它在多任务榜单表现均衡,数学能力达IMO银牌水平,通用能力逼近GPT - 5,还采用自研算法应对行业难题,目前可下载体验。

AI前线
算法论文7

ICLR 2026惊现SAM 3,分割一切的下一步:让模型理解「概念」

9月12日,匿名论文‘SAM 3: SEGMENT ANYTHING WITH CONCEPTS’登陆ICLR 2026,外界猜测出自Meta。SAM 3定义了可提示概念分割任务,性能比之前系统提升至少2倍,在多基准测试获SOTA成绩,但也有人质疑是旧概念包装。

机器之心
算法论文8

加速近5倍!北大与字节团队提出BranchGRPO,用「树形分叉 + 剪枝」重塑扩散模型对齐

北京大学与字节团队提出 BranchGRPO 新型树形强化学习方法,通过在扩散反演中引入分叉与剪枝,解决扩散/流匹配模型人类偏好对齐难题。该方法在图像与视频生成任务中表现优异,迭代时间最高近 5 倍加速。

机器之心
产品应用7

Subagents:构建高可靠 AI Coding 专家顾问团

文章探讨 Claude Code 的 Subagents 功能在复杂 AI 编程场景的价值与实践。指出复杂 AI Coding 面临上下文膨胀等问题,而 Subagents 可创建专属子代理,有 Context 保护等优点,还介绍使用方法、业务实践及相关思考。

阿里云开发者
算法论文8

挑战Claude4的8B Agent!NUS提出AgenTracer:面向多智能体系统的失败归因

随着大语言模型发展,多智能体系统潜力大但有系统脆弱性问题。NUS研究者在论文中提出AgenTracer框架,构建标注管线,设计AgenTracer - 8B模型,在失败归因任务上超大型闭源模型,还能助力系统自我提升。

PaperAgent
产品应用7

AI浏览器必火!

AI浏览器是面向大众的AI Agent,能满足智能搜索与总结、自动化任务、多模态交互等需求。目前赛道竞争激烈,作者认为Perplexity Comet是最佳产品,能处理网页内容、自动化操作,AI浏览器有望成首个杀手级AI应用。

newtype AI
开源动态8

Meta视觉基座DINOv3王者归来:自监督首次全面超越弱监督,商用开源

Meta推出并开源视觉基础模型DINOv3,采用自监督学习,首次全面超越弱监督,可生成高质量高分辨率视觉特征。它在多任务表现出色,参数和数据量提升,还构建模型家族,已在多领域产生实际影响。

机器之心
算法论文7

幻觉终结者,PoG给大模型“打补丁”

传统检索方式易给大语言模型带入噪声,知识图谱虽能提供可靠知识,但处理多跳和多实体问题有局限。Paths-over-Graph(PoG)方法通过多跳路径探索、路径剪枝等提高LLMs在复杂任务中的表现,减少幻觉。

CourseAI