大模型架构图」共找到 9891 篇相关文章

开源动态8

阿里Qwen悄悄放出6个开源权重,国庆卷疯了~

国庆期间,阿里通义千问悄悄放出6个开源模型权重,Qwen3-VL是通义千问系列最强的视觉 - 语言模型。其30B版本多模态表现媲美GPT - 5 - Mini等,功能与架构均有升级。

PaperAgent
开源动态8

重磅开源!首个全异步强化学习训练系统来了,SOTA推理模型RL训练提速2.77倍

清华学和蚂蚁技术研究院联合团队开源全异步强化学习训练系统 AReaL-boba²,坚持“全面开源、极速训练、深度可定制”理念,实现异步 RL 训练,训练速度最高提升 2.77 倍,支持多轮智能体强化学习训练。

机器之心
算法论文8

AI终于学会「读懂人心」,带飞DeepSeek R1,OpenAI o3等模型

威斯康星学麦迪逊分校联合清华学的研究《MetaMind: Modeling Human Social Thoughts with Metacognitive Multi-Agent Systems》,将元认知理论融入LLM架构,让AI“读懂人心”。其框架分三阶段,还有动态社交记忆,在多基准测试表现出色。

机器之心
新闻资讯8

一百万亿Token里的AI现状:OpenRouter和a16z重磅研究带你透视AI江湖

OpenRouter和a16z发布重磅研究,用100万亿Token绘制AI实景地图。2025年推理模型崛起,开源模型流量份额攀升,编程与角色扮演需求,还揭示了用户留存的“灰姑娘效应”等,展现多元AI世界。

AIGC开放社区
产品应用8

告别卡脖子,华为黑科技破局!昇腾推理加速1.6倍打破LLM降智魔咒

模型参数规模,推理部署难。华为诺亚提出Pangu Light框架,结合算法创新与国产昇腾平台,通过跨层注意力剪枝等技术,解决剪枝后模型失稳问题,实现高压缩率、推理加速与高精度。

新智元
新闻资讯7

太炸了!小扎2亿美金挖走了庞若鸣,比库克年薪还高

外媒爆料小扎花2亿美金挖走苹果智能基础模型负责人庞若鸣,薪酬比库克高,且部分与绩效挂钩。庞若鸣履历出色,领导苹果自研模型核心团队,成果关乎苹果产品未来。

AI寒武纪
产品应用8

18个月,中国Token消化狂飙300倍!别乱烧钱了,清华系AI Infra帮你腰斩API成本

中国模型API服务碎片化、“黑盒”问题严重,成本高。清程极智1月29日发布AI Ping,类似“中国版OpenRouter + Artificial Analysis”,可评测、路由模型,帮开发者降低成本、提升效率,还能重塑服务市场秩序。

机器之心
新闻资讯8

中国AI「星际穿越」!新智元十周年峰会预言ASI终局:未来十年指数级加速

新智元十周年峰会以「新天终启 万象智生」为主题,众多咖齐聚。王海峰、赖俊杰、王小川等分享观点,还开源模型、发布奖项。家认为AI发展虽有波折,但2027年将达ASI临界点,智能体爆发。

新智元
推荐文章7

别再构建多智能体了

Multi Agent应用有望成模型应用范式,但Cognition AI团队认为2025年追求多智能体并行协作架构是歧途,存在信息孤岛和决策冲突问题。主张采用单线程线性架构与上下文工程。

AI工程化
算法论文8

逆天!Mata用13个参数26字节让模型正确率从76%飙升至91%

Meta等机构研究人员发布TinyLoRA极致微调技术,配合强化学习,能在几乎不改变模型原有结构下,用极少数参数激发其推理能力。该技术在数学推理上表现出色,还探索了参数共享策略和存储精度问题。

AIGC开放社区