大规模专家并行」共找到 904 篇相关文章

算法论文8

手术刀式去噪突破LLM能力上限,从头预训练模型下游任务平均提高7.2% | 中科院&阿里

中科院计算所与阿里Qwen等团队联合提出RefineX框架,通过程序化编辑任务实现预训练数据精炼。它将专家指导结果蒸馏为删除程序,训练优化模型。用其净化数据训练模型,下游任务平均提高7.2%。

量子位
算法论文8

比自回归更灵活、比离散扩散更通用,首个纯Discrete Flow Matching多模态巨兽降临

近年来多模态大模型多采用自回归架构,推理缺乏灵活性。香港大学和华为诺亚方舟实验室研究团队提出FUDOKI,基于全新非掩码离散流匹配架构,能并行去噪、动态修正,为多模态模型开辟新路径。

机器之心
产品应用8

我手机里装了20个AI,最后发现只需要一个

AI工具爆炸,人们成了「AI项目经理」。百度DuMate在开发者大会展示强大能力,一句话可让三件不同工作并行执行,有技术架构支撑,已获认证且成本下降,入口之争本质是生态之争。

新智元
新闻资讯7

MMLU已死?「人类最后考试」登Nature:全球AI模型集体不及格!

AI发展迅猛,现有基准测试难以跟上其步伐。近1000名研究人员组成的全球联盟创建「人类最后的考试」(HLE),涵盖多领域难题,目前最强AI准确率不足50%,凸显AI与人类专家的差距。

新智元
产品应用7

AI+直播的新玩法! StreamDiffusionV2让创意零延迟

生成模型改变直播行业,但此前模型难保证时间一致性、有延迟等问题。加利福尼亚大学推出StreamDiffusionV2,通过智能调度和缓存机制优化,支持多GPU并行,可灵活调画质和延迟,实现实时直播。

带你学AI
新闻资讯7

AI正在疯狂吞噬一切!数据中心价值暴涨,但这场狂欢能持续多久?

文章指出AI数据中心投资使美国GDP增长显著,市场规模将大幅增长。科技巨头疯狂砸钱,投资集中在北弗吉尼亚。专家观点分裂,作者认为需求真实但短期有泡沫,投资可能推动进步,也可能重蹈覆辙。

AIGC开放社区
算法论文8

让AI读懂「言外之意」:AI4SG团队发布首个心理健康污名语料库,破解隐性偏见识别难题

心理健康患者常面临社会偏见,且这种污名化隐蔽难识别。新加坡国立大学AI4SG团队联合多学科专家,构建首个心理健康污名访谈语料库MHStigmaInterview,获ACL 2025认可,为解决该社会问题提供技术支持。

机器之心
新闻资讯8

这次,Agentic AI工程化的底牌全被抖出来了 | QCon北京2026

QCon全球软件开发大会·2026北京站4月举办,以‘Agentic AI时代的软件工程重塑’为主题。大会有主题演讲、专题演讲,汇聚一线专家探讨AI工程化等多方面内容,还关注AI向物理世界延伸,讲师分享实践经验。

PaperAgent
新闻资讯8

数据土壤,决胜 AI 下半场:一场关于企业 Data+AI 战略的炉边思辨

2026年初,Snowflake与InfoQ联合举办活动,汇聚多领域专家探讨Data+AI前沿。回顾2025年,大模型迭代、AI安全等带来认知突破;还围绕2026年十大战略命题思辨,如企业Data+AI平台挑战、开源闭源博弈等。

InfoQ
算法论文8

南大周志华团队最新力作:一个算法通吃所有,在线学习迎来新范式?

世界是动态变化的,AI 模型需具备在线学习能力,领域提出适应性遗憾值指标。现有算法通用性不足,南京大学周志华团队研究具有双重自适应性的通用算法,提出元 - 专家框架等,还研究了在线复合优化问题。

机器之心