开源推理模型」共找到 9149 篇相关文章

算法论文8

Test Time Scaling Law远未达到上限! o4-mini仅15.8%通过率,华为诺亚提出代码HLCE终极基准

华为诺亚研究员推出全新编程基准HLCE,含235道竞赛难题。实验显示,顶级LLM在该基准表现不佳,推理模型优势大,IOI交互式题难攻克。研究还发现模型自我认知与推理能力发展不同步,Test Time Scaling Law远未达上限。

机器之心
8

刚刚,国产Agent模型闯入全球第一梯队!限时免费

昆仑万维发布SkyClaw-v1.0及其轻量版SkyClaw-v1.0-lite Agent模型,性能达全球第一梯队,价格仅主流顶尖模型一半甚至更低,适配主流Agent框架,还兼容OpenAI接口,现限时免费,后续将逐步开源

量子位
开源动态8

阿里Qwen又悄悄放出8个开源权重,卷疯了~

阿里通义千问太卷,悄悄放出8个开源模型权重,包括体积更小的Qwen3-VL及FP8权重。这一代实现全方位升级,提供两种架构、两个版本,架构也有更新,还给出使用示例与模型权重链接。

PaperAgent
开源动态8

中科院类脑大模型SpikingBrain,2%数据,百倍速度

中国科学院自动化研究所李国齐、徐波团队发布全球首款大规模类脑脉冲大模型SpikingBrain 1.0。它处理长文本比主流Transformer模型快超百倍,训练数据仅为2%。该模型采用新架构,降低计算复杂度,还可转换现有模型,且在国产GPU完成训练。

AIGC开放社区
开源动态8

DeepSeek正式开源Harness:它终于有了自己的Vibe Coding入口

今晚,DeepSeek 正式发布并开源 DeepSeek Harness(DSH)开发者预览版,它是一套 Agent 运行框架。此前 DeepSeek-V4-Pro 上线,二者结合,Harness 负责将模型能力组织成可工作的 Agent,使 DeepSeek 进入相关竞争。

DeepTech深科技
算法论文7

全面评估多模态模型视频OCR能力,Gemini 准确率仅73.7%

MME - VideoOCR团队评估多模态大模型(MLLM)视频OCR能力。构建精细任务体系和高质量数据集,评测18个主流MLLM。即便如Gemini - 2.5 Pro,准确率仅73.7%,暴露出MLLM在视频OCR领域能力局限。

量子位
算法论文7

SRO架构赋予Qwen-2.5-VL推理能力,性能飙升16.8%

文本领域推理模型成就大,但扩展到多模态大语言模型遇阻力,如冷启动初始化不足等。为此提出 SRO 三阶段训练框架,经测试,ReVisual - R1 平均性能提升 16.8 个百分点。

CourseAI
开源动态8

Meta刚刚开源DINOv3,横扫60+任务,无标注封神!

今天凌晨,Meta开源视觉大模型DINOv3,采用自我监督学习,无需标注数据。它在60多个视觉任务测试中表现出色,超越同类模型。还引入后处理优化策略,扩展应用场景,能适应多种部署环境。

AIGC开放社区
新闻资讯7

理解与生成统一多模态模型:现状与未来 | 直播预约

从GPT - 4o到Gemini,AI实现跨模态联合理解与生成,核心是统一多模态基础模型。但开源社区构建强大统一模型面临挑战。南大等团队梳理超750篇论文分析技术路线,将有直播探讨现状与未来。

深度学习自然语言处理
算法论文8

推理token减少46%!Meta新方法缩短思维链,告别重复推导

Meta等联合提出元认知复用机制,让模型总结解题思路,提炼为“行为”存于“行为手册”。实验显示,该机制在数学基准测试中显著优化,保持准确率时最多减少46%推理token使用量。

量子位