「腾讯混元图像3.0」共找到 3358 篇相关文章
DeepSeek-V3.2被找出bug了:疯狂消耗token,答案还可能出错,研究人员:GRPO老问题没解决
DeepSeek-V3.2虽强且火爆,但被发现存在bug,即浪费token问题。研究者指出这源于GRPO算法的‘隐藏偏见’,虽修正了‘难度偏见’,但‘长度偏见’仍在,官方也承认token效率是挑战。
基础模型又一关键拼图,腾讯混元发布训练新范式「无相」:引入功能性记忆,打破静态权重枷锁
腾讯混元团队发布HY - WU范式,打破静态权重束缚,引入功能性记忆,实时生成个性化参数。应用于图形编辑基模效果好,在图像编辑任务表现优秀,还对未来AI架构提出多方面展望。
突破高分辨率图像推理瓶颈,复旦联合南洋理工提出基于视觉Grounding的多轮强化学习框架MGPO
先进多模态大模型处理高分辨率图像有瓶颈,复旦和南洋理工研究者提出基于视觉Grounding的多轮强化学习方法MGPO,能让模型精准推理,还可使模型从答案反馈中涌现视觉定位能力,避免依赖昂贵标注。
7B模型“情商”比肩GPT-4o,腾讯突破开放域RL难题,得分直翻5倍
腾讯混元AI数字人团队提出RLVER框架,解决开放域RL在真实交互中的‘情商’优化困境。经其训练的Qwen2.5 - 7B模型在情感对话基准得分跃升,比肩顶级商用模型,团队还有诸多启发性发现。
别再乱调图像塔了!浙大 IJCAI 论文揭露 VLM 非对称性真相,给 CLIP 微调「踩刹车」
浙大陈静远教授课题组等提出自适应非对称适配器,放弃对图像分支硬性微调,引入预测置信度自动给视觉塔‘踩刹车’。经实验总结出微调三大核心洞察,在多个数据集测试中表现优异。
谷歌突砍Gemini免费版炸锅,数据养模遭背刺?GPT-5.2突袭Gemini 3,Demis Hassabis:谷歌须占最强位
近日谷歌收紧Gemini API免费层级限制,引发开发者不满。同时,OpenAI计划提前发布GPT - 5.2竞争。谷歌DeepMind的Hassabis表示要与OpenAI竞争到底,对Gemini 3满意,还介绍了谷歌未来三个主打方向。
正交化之外是什么?微软等提出ARO优化器:训练提速1/3,揭示矩阵优化新「蓝海」
微软研究院联合多校发布论文,提出新优化器 ARO。它将梯度旋转作为原则,能让大模型训练提速约 1/3,比 Muon 高效 10% - 15%,还能全模型优化,揭示了矩阵优化新方向。
搜索智能体RAG落地不佳?UIUC开源s3,仅需2.4k样本,训练快效果好
当前 Agentic RAG 落地有挑战,UIUC 和 Amazon 提出 s3 训练范式。它仅需 2.4k 样本,训练快且效果好,解决了优化目标偏离、检索与生成耦合等问题,在通用和医学 QA 任务中表现出色。
谷歌突砍Gemini免费版炸锅,数据养模遭背刺?GPT-5.2突袭Gemini 3,Demis Hassabis:谷歌须占最强位
近日谷歌收紧Gemini API免费层级限制,引发开发者不满。与此同时,OpenAI计划提前发布GPT - 5.2应战。Google DeepMind CEO Demis Hassabis表示谷歌要占最强位,对Gemini 3满意,还介绍了谷歌未来三个发力方向。
Cursor 2.0 来了!自研模型 Composer1,更禅的界面,多代理并行,Browser调试更强大
Cursor 2.0 发布,有诸多升级。它有自研编码模型 Composer1,速度快且适合 Agent 模式;界面更清爽禅意;支持多代理并行,能提升编码效率;浏览器可嵌入编辑器,沙盒终端在 macOS 正式发布等。