混合专家架构」共找到 2359 篇相关文章

产品应用7

Cursor发布首个编程大模型!代码生成250tokens/秒,强化学习+MoE架构

Cursor 2.0正式发布,搭载自研大模型Composer。它30秒完成复杂任务,比同行快400%,每秒生成250个tokens。还带来原生浏览器工具等新功能,基于强化学习,但模型底子透明度遭质疑。

量子位
开源动态8

Google Research 开源新架构,AI 不再依赖云端,直接跑在手表和耳机上

Google Research 开源 Coral NPU 平台,是面向硬件工程师与 AI 开发者的全栈开源方案,可克服 AI 在可穿戴和边缘设备落地的瓶颈,实现能耗与算力平衡,还能解决算力、生态、隐私等问题。

InfoQ
算法论文8

谷歌DeepMind曝光首个“AI 经济体”完整架构,Agent催生全新经济体正在悄然成形

谷歌DeepMind论文描绘由AI Agent自主交易和协作的经济体,提出“沙盒经济”框架,分析其起源与隔离程度,指出发展方向及挑战,还给出应用场景、市场机制、设计方案、基础设施层和行动建议。

AI寒武纪
产品应用7

别让Nano Banana骗了!混合方案让头像生成成功率从0到100%

作者用Nano banana更新头像时发现其生成中文能力差,提出将AI画图与HTML编程结合的方案。HTML搞定确定性、成本低部分,AI画图负责复杂、创意性高部分,还给出使用方法及多种头像加字设计方案。

AI 产品自由
算法论文8

混合数学编程逻辑数据,一次性提升AI多领域强化学习能力 | 上海AI Lab

上海AI Lab的OpenDataLab团队通过大规模实验剖析RLVR在多领域推理机制。构建多领域评估框架与定制奖励策略,基于Qwen2.5 - 7B系列模型联合训练,有多项关键发现,为构建AI推理模型提供参考。

量子位
新闻资讯7

数学圈地震!o3靠直觉刷爆人类顶尖难题,14位专家集体破防

Epoch AI新研究发现,o3 - mini - high能破解顶尖数学难题,具备渊博学识且会基于直觉解题,但推理风格依赖直觉,缺乏严谨性和创造力,还存在投机取巧、幻觉等问题。

新智元
新闻资讯7

首次曝光!OpenAI新一代旗舰Astra换上“循环深度”推理架构:用计算深度换参数规模

9月2日消息,OpenAI将推出的旗舰模型Astra采用“循环深度”新技术,用较小模型实现庞大模型性能,降低成本。但该技术会让AI推理过程不可读,加重安全担忧,此前奥特曼已因Astra“能力过强”踩刹车。

AI前线
新闻资讯7

Meta详细阐述基于LLM级训练、混合并行计算与知识迁移的GEM广告模型

Meta发布生成式广告模型GEM详细信息,旨在改善平台广告推荐能力。它处理海量用户 - 广告交互数据,用三种方法构建系统,还实施GPU级优化,采用两种知识迁移策略,获业内人士认可。

AI前线
产品应用8

腾讯用AI把美术管线重新做了一遍,混元3D Studio架构曝光

腾讯推出专业级AI工作台混元3D Studio,可覆盖3D资产生产全流程,让生产周期大幅缩短。它有组件拆分、可控图像生成等七大核心技术模块,各模块对应关键阶段,实现无缝衔接与自动化。

量子位
新闻资讯8

谷歌Nature震撼发文,Gemini教练暴打专家!医学双料冠军,秒出睡眠报告

谷歌DeepMind把Gemini版大模型PH - LLM调教成「AI健康私教」,将可穿戴设备数据转化为睡眠健身建议,准确率超人类医生。它经两阶段训练,在多项测试中表现优异,或开启预防医学未来。

新智元