「核心认知基准」共找到 2692 篇相关文章
2026CSDI:AGI前夜,属于懂Agent、更懂模型的长期深耕企业
本文围绕2026年AI行业发展展开,指出竞争基本单位正从模型变为体系,AGI成组织目标,同时介绍了算力、数据等核心要素变化;还提及Agent与模型关系及编程新范式,最后宣传了2026CSDI峰会。
GAIR Paper 105|离线强化学习新突破——ROMI:破解对抗式模型学习「过保守、训不稳」深层困局|ICLR 2026
本文聚焦基于模型的离线强化学习,指出RAMBO算法存在保守性难控和训练不稳问题。为此提出ROMI方法,引入鲁棒价值感知框架与隐式可微自适应加权机制,在多基准任务上超越基线算法。
「全球大模型第一股」来了!智谱港交所敲钟,市值达528亿港元
2026年1月8日,智谱登陆港交所,成全球首家以AGI基座模型为核心业务的上市公司,市值528.28亿港元。它以‘全球大模型第一股’吸引资本,研发强、MaaS模式优,标志中国AGI企业走向资本市场。
把 AI 邮件工具做到 3500 万美元 ARR,Superhuman:找到 PMF 其实有明确的方法论
文章以 Superhuman 为例,介绍其找到产品与市场契合点(PMF)的方法论。从用户调研、开发模式、找准核心等方面构建 PMF 策略,还阐述衡量及优化 PMF 的方法,如关键指标、四步法等。
Agent规模化落地前夜,AI Infra的难题全都暴露了
随着AI Agent大规模落地,中国云服务市场结构转变,AI基础设施角色改变。InfoQ联合腾讯云发起「InfraTalk」直播,探讨AI Infra能力框架等。还解析其核心能力、难题、价值闭环标准及未来竞争焦点。
AI胡说八道这事,终于有人管了?
AI大模型幻觉问题棘手,GPT - 5幻觉率降低。苏黎世联邦理工学院和MATS研究提出低成本、可扩展检测法,精准识别实体级幻觉,分类器超现有基准,还能识别逻辑错误,团队已公开数据集。
LLM-based Reranker效果到底如何?一项关于SoTA模型的全面分析
在信息爆炸时代,重排序是信息检索系统核心。论文对22种重排序方法实证研究,构建无污染数据集FutureQueryEval。结果显示LLM重排序器泛化能力被高估,轻量级模型有优势,为研究和应用提供指南。
微软:81% 企业考虑增设 AI 岗位,未来员工会成为智能体的老板
微软发布报告显示,中国企业对 AI 应用认知转变,84%企业决策者将重新评估 AI 影响,81%企业考虑增设 AI 岗位。企业落地 AI 有三阶段,智能体以“数字员工”角色进入企业,员工与 AI 关系重要。
OpenAI首席研究员Mark Chen长访谈:小扎亲手端汤来公司挖人,气得我们端着汤去了Meta
OpenAI首席研究官Mark Chen在访谈中爆料Meta抢人大战升级成送汤大战,还谈到OpenAI核心研究团队规模、应对Gemini 3策略等。他认为OpenAI本质是研究公司,有信心在预训练和模型性能上超越对手,还提及OpenAI for Science等计划。
把VLM塞进隐式世界模型,小鹏机器人新框架让机器人长出物理直觉
机器人大脑架构中VLM和VAM路线各有短板,香港大学、小鹏机器人等团队提出DIAL框架,让VLM在原生特征空间做隐式世界建模,解耦认知决策与底层执行,在机器人部署中表现优异。