以模型为中心」共找到 8587 篇相关文章

开源动态8

DeepSeek重磅开源3B OCR模型,一天处理20万页文档!一天内斩获6K标星!

DeepSeek开源3B OCR模型DeepSeek - OCR,参数量仅30亿,单张A100 - 40G一天能处理20万页文档,不到24小时获6K标星。它是视觉压缩引擎,解决大模型处理长文本算力爆炸问题,有诸多技术亮点。

开源星探
开源动态8

开源复现o3图像思考!快手让AI不再被动看图,模型自主生成代码调用工具

Kwai Keye团队提出Thyme新范式,构建技术方案,赋予开源模型“超越图像思考”能力。包括设计训练策略、构建开源配套资源,拓展多模态模型工具使用与决策水平,在基准测试中性能提升显著。

量子位
开源动态8

百度开源视觉理解模型Qianfan-VL!全尺寸领域增强+全自研芯片计算

今天百度智能云千帆推出全新视觉理解模型Qianfan - VL并全面开源,含3B、8B和70B三个版本,基于自研昆仑芯P800计算。它特点多、性能优,应用场景广,未来还将推新产业级模型

量子位
开源动态8

视频世界模型困在像素网格里:腾讯开源SCoPE,用射线空间重写位置关系

香港大学、香港科大与腾讯ARC Lab联合提出SCoPE,让视频模型处理位置关系的基底从张量网格转向射线空间。它将相机射线坐标注入Video DiT,新增参数不到原模型0.1%,多方面表现获改善。

机器之心
开源动态7

马斯克点赞的APP来了!刚下场视频世界模型,就拿下评测第一

实时视频世界模型成热门,Loopit发布的实时互动世界模型Zing - 0.5在评测中获第一且已开源。该公司提出独特观点,认为实时视频非世界,互动应“模应一体”,还指出抵达端到端终局的新路径。

新智元
开源动态8

开放全栈!超越π0,具身智能基础大模型迎来真·开源,开发者狂喜

继π0后,具身智能基座模型WALL - OSS正式开源,多项指标超越π0。它是通用多模态具身模型,具良好推理和泛化能力。背后自变量机器人刚完成近10亿A + 轮融资,开源将降低具身智能门槛。

量子位
算法论文8

模型是否对问题难度有预判?最新研究揭示 LLM 内部的“难度感知机制”

近期论文《Probing the Difficulty Perception Mechanism of Large Language Models》系统性解答大模型能否感知问题难度等问题。研究基于数据集在主流 LLM 上训练轻量线性探针,定位负责难度感知的注意力头,还发现不同模型表现有差异。

深度学习自然语言处理
算法论文8

ACL 2026 Main|混合推理模型也会「钻空子」:南大移动团队提出TNT,破解「假装不思考」骗奖励

大型推理模型存在「过度思考」问题,训练混合推理模型易出现奖励欺骗。南大等团队提出 TNT 方法,利用思考模式解答部分为问题动态设非思考模式 token 上限,解决奖励欺骗,实现准确率与效率双赢。

机器之心
算法论文8

大语言模型离“数学证明高手”还有多远?斯坦福、伯克利、MIT 团队提出 IneqMath 评测标准

现在很多大语言模型常给出看似正确的结论,但推理过程却有问题。斯坦福、伯克利和MIT团队提出新思路,构建IneqMath数据集及‘AI数学裁判系统’,研究发现很多模型推理不严谨,还给出两个提升准确率的办法。

AI前线
开源动态7

NovaSR:一个52KB的音频超分模型,把16kHz模糊音频变成48kHz清晰版

最近,只有52KB的音频超分辨率模型NovaSR开源,能把16kHz模糊音频变成48kHz清晰版,处理速度极快,可实时处理音频流。它能提升TTS模型质量等,虽有不足,但平衡了速度与质量。

AI工程化