「混合训练框架」共找到 3582 篇相关文章
我们都错怪GPT-5了,路由统一算力,免费用户也能创造收益
GPT - 5发布后,其路由架构备受关注。开源社区的Arch - Router类似其路由系统,能结合任务领域和动作制定策略。GPT - 5路由框架可平衡成本与性能,还能转化免费流量,未来想掌控用户与模型交互路径。
拿下3D生成行业新标杆!昆仑万维Matrix-3D新模型鲨疯了,一张图建模游戏场景
昆仑万维推出3D世界生成框架Matrix - 3D,能从单图像生成高质量、轨迹一致的全景视频并还原可漫游3D空间。它优势明显,还突破多项技术难题,背后是昆仑万维对空间智能的战略布局。
Mem0,用LLM给智能体解决记忆问题,开源
大模型训练后知识和记忆不再增加,智能体记忆能力发展不理想。国外Mem0针对AI记忆技术发表论文并开源,提出Mem0和Mem0g两种方案,在不同场景表现出色,已获多应用,还提供SaaS服务。
Nanbeige4.2-3B:探索通用Agent小模型
在模型越做越大的当下,推理成本成了影响Agent大规模使用的关键因素。南北阁实验室推出Nanbeige4.2 - 3B,在架构、数据构造和训练pipeline层面做了系统工作,评测表现良好,还探索本地个人助手等应用。
梁文锋叫停签约,DeepSeek百亿新融资或全面暂停;白宫控月之暗面蒸馏Anthropic Fable 5遭驳;腾讯员工晒317万年终奖被辞永不录用|Q资讯
本文汇总一周AI行业热点,有DeepSeek百亿融资或暂停、Karpathy或从Anthropic离职等消息,还涉及腾讯、360、美团等公司动态,以及多个新模型发布与技术成果。
李飞飞 、 英伟达 Jim Fan 、徐丹飞三巨头联合重磅论文,改写灵巧手触觉赛道
近日,李飞飞、英伟达Jim Fan等顶尖学者联合发表论文《T-Rex: Tactile-Reactive Dexterous Manipulation》。指出过去具身行业在灵巧手触觉的探索方向可能错误,目前加触觉会让机器人变笨,但也给出解决方法,真机实测T-Rex表现优异。
登上Nature子刊!Meta脑机接口重大阶段性进展,超高实时解码准确率
Meta在非侵入式脑机接口研究取得重大进展,Brain2Qwerty v2能从原始脑信号实时解码句子,平均词准确率达61%,最优78%。研究团队开源训练代码,数据集也同步开放,但应用于临床仍面临精度和设备限制。
马斯克麾下最惨打工人:手滑删掉xAI三周训练数据
xAI一名员工在数据迁移时误删了2到3周的核心训练数据,这或为Grok重组震荡后遗症。xAI为追Claude等,采取喂Cursor数据、自研V9等策略,还曾借道访问竞品模型。如今xAI把算力租给对手变现。
不只是DeepSeek V4,还有个万亿级大模型,训推全程国产芯片
2026年4月24日,DeepSeek发布新一代模型DeepSeek - V4系列预览版并开源。同日,美团用全国产算力集群训练出万亿参数大模型LongCat - 2.0系列预览版,训推全流程摆脱英伟达,在国产算力支撑万亿级模型研发上取得突破。
不换GPU,性能飙升2.8倍!英伟达用软件暴打摩尔定律
2026年1月8日,英伟达官网披露,基于Blackwell架构的推理软件栈升级,让混合专家模型(MoE)推理效率迎「阶跃式」突破,单GPU吞吐飙升2.8倍,显著降低推理成本。其通过软件针对性升级发挥硬件潜力,还进行多项优化。