多角色架构」共找到 5550 篇相关文章

算法论文7

DeepSeek-R1推理智能从哪儿来?谷歌新研究:模型内心角色吵翻了

过去两年大模型推理能力跃迁,谷歌等机构研究指出,推理能力提升源于模型推理时隐式模拟类智能体交互结构“思维社会”,还提出利用“群体智慧”新方向,并介绍了研究方法、实验结果等。

AINLPer
开源动态8

不堆参数堆架构,这个8B开源模型把图像理解和生成统一了

商汤开源全新架构的理解生成统一模型SenseNova-U1,虽小尺寸版仅8B参数,却能复刻GPT - Image - 2的不少绝活,在项指标上登顶开源模型榜首,推理速度逼近主流商用闭源模型。它具备连续性图文创作等能力,底层是NEO - unify架构

量子位
开源动态8

开源音视频同步SOTA基座:极简的单流架构,2秒出片

AI视频生成迈入音视频同步新纪元,闭源巨头已展实力,而上海创智学院与Sand.ai联合发布的开源音视频生成基础模型daVinci - MagiHuman,以极简单流架构,2秒就能在1张H100显卡上生成精准音视频同步画面。

AIGC开放社区
算法论文8

全新GPU高速互联设计,为大模型训练降本增效!北大/阶跃/曦智提出新一代高带宽域架构

随着大模型参数规模扩大,分布式训练成关键路径,高带宽域设计对提升训练效率至关重要。现有HBD架构在可扩展性、成本和容错能力等方面有局限,北大、阶跃、曦智团队提出InfiniteHBD架构解决问题。

量子位
新闻资讯8

腾讯调整大模型组织架构:姚顺雨加盟,向总裁刘炽平汇报

腾讯宣布大模型组织架构调整,姚顺雨加盟。他是大模型Agent方向青年研究者,将任“CEO/总裁办公室”首席AI科学家等职。腾讯强化研发体系,混元大模型成果,AI产品有竞争力,内部推进AI变革。

量子位
算法论文8

突破单token预测局限!南洋理工首次将token预测引入微调,编程任务准确率提升11.67%

当前主流大语言模型依赖下一token预测训练,难理解跨token完整概念。南洋理工大学提出概念感知微调(CAFT)技术,首次将token预测引入微调,能让模型理解完整概念,领域实验显示其可显著提升模型性能。

量子位
算法论文8

模型大一统?1100个模型殊途同归,指向一个「通用子空间」!

约翰斯・霍普金斯大学研究发现,1100个不同神经网络,即便训练条件不同,最终权重会收敛到共享低维子空间。此研究为神经网络参数空间“通用性”提供严谨实证,虽成因待探索,但意义深远。

AINLPer
算法论文8

华为新架构砍了Transformer大动脉!任意模型推理能力原地飙升

即便Transformer是AI世界基石,但遇到复杂数学题或步逻辑推理时表现不佳。问题出在Attention机制。华为诺亚方舟实验室推出Nexus高阶注意力机制架构,能提升模型推理能力,且参数零增。

量子位
推荐文章7

AI 编程越来越厉害了,我要怎么提升自己的系统架构能力?

文章指出 AI 写代码能力提升,对程序员系统架构能力要求更高且难被替代。介绍系统设计概念,分析做系统设计的难点,给出新人提升系统设计能力的方法,还说明 AI 可辅助提升该能力。

宝玉AI
产品应用8

证明也有「选择困难症」?腾讯AI Lab与大模型研究部联手打造 MPS-Prover ,视角破解形式化推理瓶颈!

本文聚焦逐步式自动化定理证明器困境,腾讯AI Lab等提出MPS - Prover。它有数据筛选和视角树搜索两项创新,提升搜索效率和证明质量,在基准表现佳,还解决六道IMO难题。

AI科技评论