「性能工程」共找到 2601 篇相关文章
黄仁勋率先开源量子AI大模型
英伟达推出全球首个开源量子AI模型家族NVIDIA Ising,含校准和纠错模型。它简化对复杂物理系统的理解,为量子纠错和校准提供高性能工具,有望加速量子系统实用化。
南大团队直击大模型高分神话:人类90分,最强模型仅49分
南京大学傅朝友团队在Google Gemini评测团队邀约下推出视频理解新基准Video - MME - v2。它有创新的分层能力体系与组级非线性评分,经超3300人工时标注。评测显示模型与人类差距大,还揭示传统Acc指标虚高、‘Thinking’并非总增益等现象。
豆包「打电话」升级 Seeduplex:周围再吵,只认准你的声音
作者分享使用豆包语音通话功能体验,发现它换了新语音模型 Seeduplex。该模型是原生全双工语音大模型,解决半双工问题,在复杂场景表现出色,还介绍其技术逻辑及对行业的影响。
扒一扒Meta全新大模型Muse Spark里藏着的PDR技术
Meta发布闭源大模型Muse Spark及‘沉思模式’,背后藏PDR推理技术。该技术通过‘并行起草+精炼’突破性能瓶颈,对比传统长CoT范式优势明显,在AIME竞赛题目测试中准确率显著提升。
全民养虾,百虾大战,但2026年了,99%的企业用AI还是没赚到钱。
2026年,99%企业用AI未盈利。如今模型性能差距小,壁垒在context。Data不等于Context,企业需挂钩业务结果、构建反馈闭环与专属上下文系统。特赞GEA是这样的企业级智能体系统。
OpenAI 推出“超级应用”,开抢 Anthropic 的企业客户
据《华尔街日报》,OpenAI 计划整合 ChatGPT、Codex 及 Atlas 浏览器为桌面“超级应用”,收缩战线聚焦企业和工程用户场景。Anthropic 也推进贴近桌面工作流产品,双方都在将 AI 往桌面工作流入口方向发展。
AI 智能体实践评估:基准、框架与经验总结
文章为将 AI 智能体从原型落地到生产环境的团队提供实用评估框架。指出传统评估不适用于智能体,介绍评估工具,阐述五大评估支柱,还给出基于 Claude 和 LangChain 的评估示例及实践经验。
ICLR 2026 | 当视频难以被表征:UCSD、HKUST等机构联合提出FlowRVS,用生成式流匹配重构视觉感知范式
计算机视觉领域传统表征方法在视频处理上力不从心,SGIT AI Lab等机构团队提出FlowRVS,跳出传统桎梏,用生成式流匹配重构视觉感知范式,实现SOTA提升,还展现诸多优势,证明Flow Matching理论普适性。
捅破具身智能天花板!极佳视界新VLA大模型登场,复杂长时程任务近100%成功率
极佳视界推出GigaBrain-0.5M*VLA大模型,以世界模型条件驱动,引入人在回路持续学习机制。在与主流方法对比中,任务成功率提升30%,长时程任务近100%成功,还具备高效准确的价值预测能力。
清华传奇姚顺宇立功!全新Gemini一夜血洗编程,全球仅7人能赢它
谷歌Gemini 3 Deep Think重磅升级,几乎刷爆全领域SOTA。编程界冲入Codeforces人类TOP 10,人类最后考试等测试也表现优异。还能解决科研工程难题,实测物理模拟能力强,给OpenAI带来压力。