「开源视觉模型」共找到 9111 篇相关文章
DeepDiver-V2来了,华为最新开源原生多智能体系统,“团战”深度研究效果惊人
华为发布DeepDiver-V2原生多智能体系统,采用“团队作战”模式,在复杂知识问答和长文报告生成上表现出色。它以Planner为中心协调多个Executor,有智能任务分解等优势,训练也有新机制,昇腾NPU集群加速。
刚刚,腾讯姚顺雨署名首篇论文发布,「下半场」先搞上下文学习
腾讯混元团队和复旦联合团队发布姚顺雨署名首篇论文《CL - bench》。论文证实模型在上下文利用上有能力短板,还构建了CL - bench评测基准,评估发现前沿模型在上下文学习上表现差,未来要让上下文学习走向现实。
突破Pass@1瓶颈:一种让LLM自我博弈、永不枯竭的RL新范式,超越基线22.8%!
近年来,基于可验证奖励的强化学习(RLVR)在提升大型语言模型(LLM)推理能力上有关键作用,但存在熵崩溃问题。论文提出SVS创新策略,让模型自我合成变分问题形成自我提升循环,实验效果惊人。
博士学位答辩PPT分享 | 基于机器学习的复杂流场预测方法研究
左奎军博士论文聚焦基于机器学习的复杂流场预测,以多种对象构建智能流场预测网络架构,发展耦合求解方法,剖析核心要素影响,提出多个创新模型和策略,还分析了不同模型在流场预测中的表现与问题。
我做了个 Claude Code 对话共享工具,可以让别人半路接手你的工作。已开源
作者开发开源工具 cc-go-on,解决 Claude Code 等工具会话难共享问题。该工具可加密导出会话,支持接力对话,有五层安全防护,适配多工具,还待完善,邀开发者贡献。
清华新框架让大模型学会「精读略读」!实现12倍端到端加速,基准评分翻倍
清华等团队提出全新框架RAM,受人类阅读认知启发,将“精读+略读”混合策略引入上下文压缩,突破现有方法效率瓶颈,在多任务上表现出色,实现12倍端到端加速,为长上下文LLM部署提供新范式。
微软发布GUI Agent新范式!告别传统方式,小参数少数据,7B吊打72B模型
微软发布GUI Agent新范式GUI - Actor,告别传统Agent定位死板、缺乏空间感和兼容性差等问题。它用无坐标交互技术,在测试中表现优异,省数据算力,未来在多领域有应用潜力。
GPT-5来了!人人都能免费用,最强大模型只需最傻瓜式使用
全世界等了2年,GPT - 5正式发布,面向所有人免费开放。它在AIME 2025取得优异成绩,编程等方面全面提升,集成多模态和推理能力,还推出多种使用模式和API模型,不过也遭马斯克等质疑。
首个开源实现100%可复现的稳定RL训练框架来了!2次结果完全重合
SGLang团队联合slime团队开源实现100%可复现的稳定RL训练框架。基于Qwen3 - 8B重复实验结果完美重合。SGLang在批次不变算子基础上实现确定性推理,性能有下降但有提升空间,还给出使用方法和未来规划。
加速近5倍!北大与字节团队提出BranchGRPO,用「树形分叉 + 剪枝」重塑扩散模型对齐
北京大学与字节团队提出 BranchGRPO 新型树形强化学习方法,通过在扩散反演中引入分叉与剪枝,解决扩散/流匹配模型人类偏好对齐难题。该方法在图像与视频生成任务中表现优异,迭代时间最高近 5 倍加速。