「推理评测」共找到 2557 篇相关文章
DeepSeek-V3.1震撼发布,全球开源编程登顶!R1/V3首度合体,训练量暴增10倍
DeepSeek正式上线DeepSeek-V3.1,作为首款「混合推理」模型,将开启智能体新时代。它参数共671B,具强大智能体能力,编程击败Claude 4,训练量大幅扩增,在多方面测试表现出色,稳坐编程开源第一王座。
GPT‑5深夜发布:模型之战结束,Agent之战开始!
昨晚,炒作一月的GPT - 5正式发布,标志原生Agent时代到来。体验显示其压低幻觉、提升指令遵循与推理能力。文中还对比了GPT - 5、Gemini、Claude等模型在不同场景表现,指出御三家路线分化及三条反常识判断。
One RL to See Them All?一个强化学习统一视觉-语言任务!
国内初创公司 MiniMax 提出 V-Triune 系统,可让 VLM 单一训练流程学视觉推理和感知任务。它含三个组件与动态 IoU 奖励机制,基于此的 Orsta 模型在多项测试中性能提升显著,凸显统一 RL 方法有效性和可扩展性。
供需失衡的窗口期里,商汤大装置把国产算力做成了正毛利生意
WAIC期间,商汤大装置举办AI基础设施论坛,展示国产算力成绩单,将国产芯片业务毛利率做到正数。其通过异构混合推理等操作方法论,提升芯片利用率,还在多领域合作,虽红利或收窄,但方法论有长期价值。
从分钟级等待到20倍超速:LightX2V重写AI视频生成速度上限
今年,开源项目LightX2V在ComfyUI社区走红,单月下载超170万次。它是面向低成本、强实时视频生成的推理技术栈,能在消费级显卡上高效生成视频,还支持多种模型和硬件,覆盖不同用户需求。
首发 | 陈天桥盛大团队,推出最强开源记忆系统EverMemOS
EverMind团队发布面向人工智能智能体的长期记忆操作系统EverMemOS。它在主流评测集表现超此前工作成新SOTA,受人类大脑记忆机制启发设计,有四层架构和三大特点,已开源,后续将推云服务。
Sea AI Lab 揭秘:你费尽心力调的 LLM 一直在崩溃?罪魁祸首可能只是一个参数:BF16
Sea AI Lab 和新加坡国立大学研究指出,强化学习微调中训练不稳定和性能瓶颈,根源是数值精度 BF16。其低精度造成“训练 - 推理不匹配”,使训练易失败。将精度切换到 FP16 可解决问题,提升模型表现。
开源!强效果,高性能,严隐私?我全都要:OPPO 终端大模型实践
OPPO AI 中心推出开源端侧多模态大模型 AndesVL,含 0.6B - 4B 四档尺寸套件,有通用能力强等优势。它经多阶段训练,OPPO 还构建端侧部署方案,评测显示其在多方面表现优异,未来会继续技术革新。
内幕曝光:OpenAI模型坦承不会第六题,3人俩月拿下IMO金牌!
OpenAI三人团队俩月让AI达IMO金牌水平。他们用多智能体系统技术,使模型能短时间解复杂问题。新模型有自省能力,减少“幻觉”问题。此次突破是通用推理技术进步,未来将整合进更多模型。
GPT-5.6 Sol暴涨3倍,OpenAI最强视觉AI登顶!
第三方评测机构Roboflow测试显示,GPT-5.6 Sol在目标检测、计数等视觉任务上表现出色,尤其在文档版面识别和密集场景处理上进步明显,但认字能力有退步,且大尺寸图片检测框易飘移。