「指标驱动」共找到 874 篇相关文章
用「进化+压力测试」自动生成的竞赛级编程题,各家大模型谁更hold住?
北京大学与通用人工智能研究院联合提出 UniCode 框架,构建进化式评测系统,能自动生成高质量算法题目与抗污染测试用例。通过对 19 个前沿大模型测试,展现高挑战性与强判别力,为代码能力评估开辟新路径。
攻克长文档与多模态挑战,Paper2Video实现学术视频的自动化生产
新加坡国立大学 Show Lab 团队主导研究,提出 Paper2Video 基准及评价指标,还推出 PaperTalker 多智体框架实现学术视频自动化生产,实验显示其在多方面表现佳,效果接近人工水平。
中国移动副总经理陈怀达:AI时代,真正的竞争力不在于单一技术的领先
10月19日,中国移动副总经理陈怀达在2025世界VR产业大会演讲指出,VR与AI深度融合,‘AI+’时代有‘三个加速融合’趋势。他还提出关注方向,分享了中国移动‘VR+AI’融合发展体系实践。
科技赋能艺术 让多样文明在数字时代华彩绽放 |国家大剧院受邀参加第二十四届中国上海国际艺术节
国家大剧院院长王宁在第二十四届中国上海国际艺术节演讲,阐述艺术与科技融合内涵,指出科技为艺术注入动能、艺术推动技术迭代、二者融合构建文化共享模式,还提出四点倡议促发展。
OneSearch,揭开快手电商搜索「一步到位」的秘技
本文介绍快手提出的电商搜索端到端生成式框架 OneSearch。它有三大创新,包括 KHQE 模块、用户行为序列注入策略、偏好感知奖励系统。实验显示它在多方面提升显著,已部署于快手电商搜索场景。
刚刚,OpenAI任命新印裔CTO!11亿美金连公司打包收购,接管ChatGPT产品核心
OpenAI斥资11亿美金收购实验平台Statsig,其CEO Vijaye Raji成应用部门新CTO,将负责ChatGPT等产品工程。同时启动「OpenAI for Science」项目,打造AI驱动的科学发现平台。
为什么 AI Agents 按结果定价这么难?
文章探讨AI Agents按结果定价难的问题。指出因技术、组织和文化基础设施缺失,短期内该模式是“海市蜃楼”,分析归因、衡量、信任、组织、市场等方面难题,也给出务实推进步骤。
谷歌提出破局Self-Consistency计算瓶颈!LLM推理效率革命,推理加速不牺牲精度
Google Research等团队提出CISC,通过给推理路径赋予置信度权重,少量样本即可超越传统自洽性效果,平均减少40%计算成本,还提出WQD指标揭示模型自评估能力本质。
“老中间件”自救:昔日并发王者、十五年开源老将全力押注Agentic AI找活路,转型做 Java 版 LangChain
7月14日,老牌开源中间件Akka发布Agentic Platform,向AI驱动型系统转型。其运营曾面临挑战,现全力押注Agentic AI,认为这是第五次计算浪潮,将构建比Langchain更丰富的功能集。
DeepSeek 复盘:128 天后,为什么用户流量一直在下跌?
文章深入分析DeepSeek和Anthropic策略,揭示行业计算资源稀缺难题。指出AI服务定价是延迟、吞吐量、上下文窗口三个指标的权衡,DeepSeek牺牲体验换研发,Anthropic提升‘智能密度’优化资源。