Agent 架构」共找到 4229 篇相关文章

算法论文8

不止Deep,更要Wide:清华、无问芯穹发布多智能体系统WideSeek-R1,4B模型比肩671B模型!

清华与无问芯穹的RLinf团队提出「广度扩展」,发布多智能体系统WideSeek-R1。它采用「Lead-agent-Subagent」框架,经MARL端到端训练,4B模型在广度搜索任务表现比肩671B模型,且在标准QA任务也出色。

机器之心
开源动态8

Transformer 中的专家混合模型 (MoE)

文章介绍Transformer中专家混合模型(MoE),它能解决稠密模型扩展瓶颈。阐述其优势,如计算高效、适合并行等,还介绍在transformers库中支持稀疏架构的演进,包括权重加载重构、专家执行后端、专家并行及训练方案。

Hugging Face
产品应用7

Claude Code auto mode 解析:如何用 AI 分类器替代人工审批

Anthropic 发布 Claude Code 的 auto mode 解决审批疲劳问题,用 AI 分类器替代人工审批。介绍了其核心思路、判断危险的标准、两阶段分类等,还分析了漏检率、被拦截后的处理及子 Agent 检查等,也指出了目前局限。

宝玉AI
新闻资讯8

一个大脑控制所有机器人,真的可能吗?特斯拉、Skild AI、Agility 激辩人形机器人的量产路线|GTC 2026

GTC 2026 上,特斯拉、Skild AI 等公司就人形机器人量产路线展开讨论。涉及数据采集、仿真作用、模型架构等话题,各公司观点不一,如特斯拉强调端到端,Skild AI 看重通用大脑,反映出行业在迈向量产时的探索与分歧。

AI科技大本营
新闻资讯7

龙虾社交上线40天被Facebook收购!俩文科创始人加入超级智能实验室

刚上线40天的AI Agent社交网站Moltbook被Meta收购,两位文科创始人将加入Meta超级智能实验室。Moltbook因人类冒充AI的假帖子爆火,但安全漏洞明显。Meta看中其让AI智能体在线连接的能力,或优先修复安全问题。

量子位
产品应用8

豆包 Seed 2.0 来了:字节模型跨越鸿沟

春节前字节发布豆包大模型 2.0,其在 Text 领域进入榜单前十,视觉能力全球第四且成本低。它定位多模态 Agent 模型,有多种能力升级,文中用多个案例展示其强大,还强调字节重原生能力非简单蒸馏。

MacTalk
新闻资讯7

“代码 + 编译器”要消失了?马斯克在 xAI 全员会上放话:到今年年底,AI 或将直接生成二进制

xAI 近期出现离职潮,马斯克公开全员大会视频回应。他表示离职是阶段适配问题,还预测到 2026 年底 AI 或直接生成二进制,跳过编程。此外介绍了 xAI 新架构及各团队进展,强调基础设施重要性,甚至提及将算力扩展到月球。

AI前线
新闻资讯8

“AI 工程师”已上岗!微软 CEO 曝正尝试新学徒制模式:内部工程师的顶级实践全变

在达沃斯论坛上,微软 CEO 萨蒂亚·纳德拉与英国前首相聚焦 AI 应用话题。他以自身参会准备工作变化,说明 AI 打破传统层级架构。还指出企业 AI 应用有‘杠杆效应’,人才差距在应用推进力度,判断泡沫关键在于落地。

AI前线
开源动态8

DeepSeek 模型技术之旅:从 V3 到 V3.2

本文深入剖析了 DeepSeek 模型从 V3 到 V3.2 的技术演进,对比了基座与推理模型,介绍了架构、训练方法变化,如 V3.2 结合 MLA 与 DSA,更新奖励和 GRPO 算法,还提及 V3.2-Speciale 扩展思考特性。

深度学习自然语言处理
算法论文8

ENG APPL COMP FLUID | 西北工业大学赵书乐、张伟伟:欧拉方程嵌入的壁面压力和摩阻分布机器学习方法

传统气动力建模依赖大量样本、泛化能力弱。本文将欧拉方程无粘特征融入建模,配合架构与损失函数设计,让模型在复杂状态保持泛化能力,集中力误差约3%,小样本建模时样本量比传统方法降2倍以上。

力学与人工智能