大模型预训练」共找到 9539 篇相关文章

新闻资讯8

0.027B手机AI模型,估值2亿美金,三个清华学霸如何获得国际学生创新赛冠军

10月15日,清华万格智能团队“基于类脑架构的下一代通用模型与智能体生态”获中国国际学生创新赛(2025)冠军。团队由三个清华本科生创立,此前已完成融资,估值达2亿美元。其智人HRM模型有诸多优势,还研发出顶尖气候预测专家模型

AIGC开放社区
产品应用7

Cursor为Blackwell从零构建MXFP8内核,MoE层提速3.5倍,端到端训练提速1.5倍

Cursor团队从NVIDIA的Hopper H100s升级到Blackwell B200s后遇性能瓶颈,他们回归基础,从零重写MoE训练层,抛弃对现有CUDA库依赖,释放了Blackwell架构潜能,实现MoE层和端到端训练提速。

机器之心
开源动态8

他们让万亿参数RL学会了「省着跑」,顺便砍掉九成算力

2025年,强化学习成模型进化主战场,但万亿参数模型跑RL成本高。Mind Lab团队实现1T参数模型LoRA高效RL训练,GPU消耗降90%,技术开源。此外还有Memory Diffusion记忆机制等成果。

量子位
算法论文8

迈向原生全模态AI智能体:人&小红书发布OmniGAIA新基准

中国人民学等团队推出 OmniGAIA 新基准及 OmniAtlas 训练框架。OmniGAIA 含 360 个高难度任务,覆盖多领域。实验显示闭源与开源模型差距,OmniAtlas 显著提升开源模型表现,并指出未来全模态智能体发展方向。

PaperAgent
算法论文8

多模态幻觉的病因「高熵节点」找到了!全基准幻觉率下降

多模态推理模型的幻觉常出现在生成转折词时,此时模型处于高熵关键节点,易脱离图像证据。研究者提出LEAD,高熵时保留候选推理方向,注入视觉锚点拉回证据,实验显示它能跨领域提升模型性能。

新智元
新闻资讯7

AI圈水太深:OpenAI保密、Meta作弊!国产MoE却异军突起

文章梳理语言模型发展,从传统稠密架构到稀疏MoE架构,参数从百亿到万亿。介绍OpenAI、Meta等厂商模型,如GPT系列、Llama系列,还提及Mixtral、DeepSeek V3等。指出Meta作弊丑闻,国产MoE模型异军突起。

新智元
产品应用7

Cursor Composer 2.5 拆解:最强的 RL 环境,就是你自己的产品

今年5月,Cursor推出Agentic编程模型Composer 2.5,相比前代能力更强、成本效率更高。Cursor研究负责人认为最强的RL环境就是自己的产品,文中还介绍了Composer 2.5训练方式、面临的挑战及解决办法等。

Founder Park
产品应用7

黄仁勋预言的100万亿市场,被易鑫金融Agent撞开一道口子

模型在金融行业落地潜力但门槛高。易鑫依托行业经验,推出Agentic AI解决方案,由XinMM - AM1模型和Harness体系组合,覆盖汽车金融全链路,已在风控等场景应用,拉开效率革命序幕。

新智元
新闻资讯7

ChatGPT确认卖广告!奥特曼:挣钱嘛不寒碜

2026年1月16日,OpenAI官宣ChatGPT免费版和Go版引入广告。奥特曼称因多数人想用AI又不付费,只能以此盈利。这背后是模型行业受开源模型冲击,陷入定价困境,开源模型改变了行业预期和估值逻辑。

新智元
产品应用8

豆包「打电话」升级 Seeduplex:周围再吵,只认准你的声音

作者分享使用豆包语音通话功能体验,发现它换了新语音模型 Seeduplex。该模型是原生全双工语音模型,解决半双工问题,在复杂场景表现出色,还介绍其技术逻辑及对行业的影响。

特工宇宙