多角色架构」共找到 5551 篇相关文章

开源动态8

谷歌T5Gemma重燃架构之战!「套壳」反杀Gemma本尊,9B推理快得离谱

2023年以来大模型战场由decoder - only架构主导,Google双线出击。T5Gemma重燃encoder - decoder架构战火,性能提升显著;MedGemma坚守decoder - only路线,强攻医疗模态,击穿闭源壁垒,打响开源反击战。

新智元
算法论文8

为MoE解绑:全新「专家即服务」推理架构发布,超细粒度扩展锐减37.5%成本

近年来大模型推理开销增长,MoE架构虽能避免计算量同比增,但带来扩展性差、容错性低、负载不均等问题。为此作者提出全新「专家即服务」推理架构EaaS,实验显示它能锐减37.5%成本。

机器之心
推荐文章8

硬核拆解大模型,从 DeepSeek-V3 到 Kimi K2 ,一文看懂 LLM 主流架构

本文详细列举 8 个主流大语言模型,硬核拆解架构设计与革新思路,介绍架构演进趋势。如 DeepSeek-V3 的 MLA 与 MoE 技术,OLMo 2 的归一化策略,Gemma 3 的滑动窗口注意力机制等。

机器之心
算法论文8

大模型如何泛化出智能体推理能力?清华提出策略游戏自博弈方案MARSHAL

近日,清华大学等机构研究团队提出 MARSHAL 框架,利用强化学习让大模型在策略游戏自博弈。实验表明,轮、智能体训练提升了模型博弈决策水平,将推理能力泛化到通用智能体系统,在一般推理任务表现显著提升。

机器之心
新闻资讯8

2025世界人工智能大会特别推荐!10国20位艺术家邀你开启与AI的深度对话

2025世界人工智能大会特别推荐的‘提视造境:国际人工智能艺术文献展’,由上海民生现代美术馆主办,汇集10国20位艺术家31件/组作品。分五大板块,探讨AI艺术议题,是人机共演的艺术实验。

MANA新媒体艺术站
产品应用8

还得是华为!Pangu Ultra MoE架构:不用GPU,你也可以这样训练准万亿MoE大模型

华为盘古团队发布Pangu Ultra MoE模型架构与训练方法的中文技术报告。该模型全流程在昇腾NPU上训练,团队在架构和训练方法创新,实现准万亿MoE模型训练,还在方面优化提升性能。

机器之心
开源动态8

狂涨 36.9K star!!看看人家的开源微信机器人优雅,微信、飞书、钉钉支持,效率飙升!

开源君介绍超火的开源项目`chatgpt-on-wechat`(CoW),它结合大模型与社交、办公平台,可定制优化。能接入平台,支持模型,处理模态消息,有丰富插件,还能记忆会话、定制知识库。给出安装步骤。

开源先锋
新闻资讯7

架构彻底重构!DeepSeek新模型代码曝光,要来的V4让国内外都坐不住了?

DeepSeek官方GitHub代码库曝光代号“MODEL1”新模型线索,或为V4内部代号。代码显示其有重大架构变更,能并行处理稀疏与稠密计算,适配英伟达新架构。此前R1发布推动中国AI开源生态发展,新模型备受期待。

InfoQ
Product Application7

Wan 2.6 发布,可以参考视频进行角色扮演 & 终于有积分了:每天 150

Wan 2.6发布,积分从每天10个提升到150个。更新了主演、镜头叙事、图像生成等新功能,如可将参考视频角色放入新场景,简单提示自动生成镜头叙事视频等。

AI进修生
新闻资讯7

Claude神之bug:给自己下指令,还诬赖用户??Hacker News炸了

强如Claude也现诸bug,如分不清发言角色,把恶意注入指令当用户请求。技术根源是Transformer架构注意力机制盲区。网友给出避坑方案,还吐槽Claude算力调整、计费乌龙等问题。

量子位