「训练推理效率」共找到 4360 篇相关文章
DeepSeek识图模式全量上线,却认不出自家老板梁文锋
端午节前,DeepSeek全量推送识图模式。测试发现,它能认出黄仁勋,但忽略‘豆汁’字样,识别人物和潦草汉字准确率低,不过识别文物能力不错。还比较了与其他模型在乐理推理测试中的表现,开发者有新疑问待解答。
小米万亿模型全面开源:MIT 协议、1M 上下文,但还是打不过 DeepSeek
小米开源 MiMo-V2.5 和 MiMo-V2.5-Pro 两款模型,采用 MIT 协议,适合商业应用。在基准测试中表现出色,有竞争力价格和限时优惠。但与 DeepSeek 比,架构创新偏工程化,也有推理表现不足等问题。
相机参数秒变图片!新模型打通理解生成壁垒,支持任意视角图像创作
S-Lab等机构研究员提出Puffin统一多模态模型,它能整合理解相机参数与按参数生成对应视角图片的能力。通过“用相机思考”和400万组数据训练,解决此前模型问题,还构建相关数据集和评测基准,性能出色。
英伟达韩松团队新作:具有后神经架构搜索的高效语言模型
英伟达韩松团队推出基于后神经架构搜索的高效语言模型Jet - Nemotron,在基准测试中表现出色,准确率与Qwen3等相当甚至更优,生成吞吐量大幅加速。模型构建经多步骤优化,代码和预训练模型将开源。
半年研发、1周上线,1秒200行代码爆发?美团研发负责人:靠小团队奇袭,模型和工程能力突破是核心
6月10日美团推出首款AI Coding Agent产品NoCode。美团基础研发平台工程效率负责人程大同在访谈中解答诸多问题,如模型性能优化、产品竞争力、用户使用难点等,还提及产品未来规划和对行业发展的看法。
VLA统一架构新突破:自回归世界模型引领具身智能
北京智源研究院联合中科院自动化所提出 UniVLA 全新 VLA 模型架构,基于全离散、自回归机制建模多模态信号,后训练引入世界模型。它刷新多项基准纪录,在真机操控和自动驾驶有潜力,为多模态感知决策融合带来新思路。
OpenAI重回巅峰:GPT‑5.5全球SOTA,碾压Opus 4.7
OpenAI发布GPT - 5.5,定位为‘为真实工作而生的新一代智能’。它在编码、科研、办公等多领域表现出色,能力重心转向‘自主完成任务’,在多项评估中成绩优异,还能加速生物医学研究,且Token效率大幅提升。
Thinking Machines首款产品重大更新:K2 Thinking、Qwen3-VL都可以微调了
由前OpenAI CTO创办的Thinking Machines Lab推出的首款产品Tinker API有重大更新。取消候选名单面向所有用户,还可微调Kimi K2 Thinking,新增兼容OpenAI API接口,支持Qwen3 - VL视觉输入,降低模型训练门槛。
大模型七连发,外国人馋透了!阿里云栖大会全栈升级够狠
阿里在2025云栖大会全栈升级,发布七款通义新模型,从基础大模型到各专项领域全覆盖。旗舰模型Qwen3 - Max性能超GPT - 5等,新架构Qwen3 - Next实现效率突破,多模型开源且表现出色。
社区供稿丨揭秘端到端文档OCR模型 POINTS-Reader
腾讯开源端到端文档OCR模型POINTS-Reader,论文被EMNLP 2025主会录取。它提出可扩展数据生成方案,具简洁、性能好、高吞吐量等特点,通过两阶段训练方案解决依赖蒸馏数据问题,在多基准测试表现佳。