专家并行性」共找到 1158 篇相关文章

开源动态8

AI能否独立开展科研?ASI-Bench为科学自主建立评测标尺

ASI-Bench是衡量AI系统科学自主的基准测试,由多机构联合开发。它能测试AI通用智能、创新和执行力,通过信息梯度设计,让模型在不同指导量下完成科研任务,结果显示当前AI离自主科研有明显距离。

机器之心
算法论文8

让沉默三千年的甲骨开口:首个模仿人类专家工作流的辅助释读系统

近日,华中科技大学等联合团队推出首个模拟专家释读流程的人工智能系统AlphaOracle,辅助甲骨文破译。它整合多类资料,形成证据链,经专家评估,有较高评价且能节省分析时间。

新智元
推荐文章8

NVIDIA技术沙龙 《大规模EP优化:PD分离MoE并行方式》课程笔记

本文是NVIDIA技术沙龙课程笔记,介绍大规模EP优化的PD分离MoE并行方式。涵盖PD分离、大规模专家并行等五项关键技术创新,还对比多模型架构,展示推理服务架构能特点与优化策略,以及各技术工作流程和效果。

GiantPandaLLM
产品应用8

牛,AI 写代码进入“编排时代”:Vibe Kanban 让多个 Agent 并行干活~~~

用Claude Code等写代码常需排队,Vibe Kanban思路直接,把AI coding agent当“同事”,用看板分配任务、并行跑多agent、可视化review改动。它亮点多,有多种使用场景,5分钟可上手。

小华同学ai
新闻资讯8

专治智能体盲跑!微软发布AI Agent 5大可观测,打通任督二脉

今天凌晨微软官网发布AI Agent 5大可观测最佳实践,解决智能体盲跑等难题。介绍了智能体可观测概念和好处,展示5个应用案例,还阐述5大实践,如选模型、持续评估、集成CI/CD等。

AIGC开放社区
算法论文8

北大卢宗青团队新作:超 70% 实机成功率,支持语言指令的功能抓取系统

现有抓取研究多在稳定层面,而功能抓取更接近真实世界的智能。北大卢宗青团队提出DemoFunGrasp方法,对功能抓取重新建模,在仿真与真实场景均超70%成功率,还引入视觉语言模型让机器人理解语言指令。

AI科技评论
算法论文8

阿里通义发布并行计算新策略:1.6B等效4.4B,内存消耗骤降95%

阿里通义团队提出PARSCALE并行计算新策略,受CFG双路径推理机制启发,将并行思想扩展到训练和推理全流程。能让1.6B模型能接近4.4B模型,内存占用大降,还可用于现有模型,无需从头训练。

量子位
新闻资讯7

AI 时代的新可观测:不只看系统崩没崩,还要看模型有没有胡说

New Relic首席技术战略官Nic Benders与主持人探讨可观测从传统到AI驱动的演进,提及LLM与统计方法协同处理海量数据,还讨论了监控AI系统的难题及可观测核心是理解业务目标。

InfoQ
算法论文7

deepseek-V4算法工程技术深入浅出

文章围绕deepseek V4技术报告展开,指出当前大模型训练不充分,介绍了算法层面如混合注意力机制、模型结构优化、优化器等,工程层面如细粒度专家并行、算子内核开发等,以及后训练的范式转变和领域专家网络蒸馏等内容。

Agent的潜意识
算法论文8

RL 将如何提高具身大模型 VLA 泛化?清华大学团队NeurIPS 2025文章分析 RL 与 SFT 泛化差异

清华大学团队在NeurIPS 2025发表文章,揭示强化学习(RL)提升具身大模型VLA泛化能力的优势,对比其与SFT差异,还提出评测基准和训练方法,为VLA训练提供新方向。

机器之心