「评测范式」共找到 1556 篇相关文章
AGI是否需要世界模型?顶级AI专家圆桌论道,清华求真书院主办
2025年7月20日,2025基础科学与人工智能论坛举行,孙茂松、刘铁岩等顶尖AI专家围绕AI根本问题展开讨论,涉及因果性、世界模型、原创能力、算力等方面,为AI技术发展勾勒图景与挑战。
机器人长出800个心眼?阿里达摩院开源具身新大脑,硅谷又坐不住了
2026年具身智能竞争激烈,阿里达摩院开源RynnBrain“具身大脑”。它采用分层架构,在16项评测中超越前沿模型。还介绍了核心技术、训练策略等,且全系列模型、评测基准和代码均开源。
蚂蚁 | 提出代码检索/重排基准:CoREB,揭开高分榜背后的三大幻觉,现已接入MTEB
蚂蚁研究人员提出代码检索与重排评测基准CoREB,解决现有基准相关性软、数据污染、任务方向单一问题。它已集成进MTEB,收录19个模型×6个任务评测结果,为代码检索模型评估提供新基线。
【CIKM'2026】CQ-SID:LLM生成式检索在手猫搜索召回中的探索与应用
文章围绕LLM生成式检索在手猫搜索召回的应用展开。先点明当前搜索召回机制问题及生成式检索挑战,提出CQ - SID等方法,经实验验证其效果佳,还介绍了线上实验成果,最后展望未来探索方向。
Loop Engineering 实战:实现从日志扫描到预发部署的全自主闭环
文章分享 Loop Engineering 实战经验,指出传统维护循环存在看不见、记不住、没闭环问题。介绍了从 Prompt 到 Loop 的四代 AI 工程化范式,阐述 Loop 原理、组件及落地实践,还提及范式迁移和踩坑教训。
视频生成Prompt何须仅是文字!字节&港中文发布Video-As-Prompt
AI视频生成中,依赖抽象语义控制的创作因缺乏统一条件表征而困难。字节与港中文团队提出Video - As - Prompt框架,引入‘视频参考’范式,实现抽象语义下可控视频生成范式统一,代码和数据集已开源。
3个月手搓Gamma架构,这个团队打造出了场景白盒化推理的“下一代内容OS”
AI应用从生成范式转向任务执行范式,Pi团队3个月手搓Gamma架构,打造出场景白盒化推理的“下一代内容OS”。Pi将AI生成与人的编辑能力结合,解决传统创作难题,实现创作全流程系统内闭环。
让AI自己设计芯片!中国科学院发布「启蒙」,芯片全流程自动设计
近日,中科院计算所联合软件所推出「启蒙」系统,基于AI实现处理器芯片软硬件全流程自动设计,达到或部分超越人类专家水平。该系统在多方面表现出色,如设计的CPU达ARM Cortex A53性能等。
Codex龙虾化!推出手机远程控制,与Claude Code竞争白热化
OpenAI的Codex可手机远程控制,与Claude Code竞争白热化。它跨设备无缝同步,支撑体验的是安全中继层技术。个人开发者体验提升,企业级环境诉求也得到回应,还推出针对性扩展工具。
Agent Infra 实践复盘:Kimi 如何搭建 Agent 背后的 Database 服务
PingCAP 联合创始人黄东旭复盘 TiDB Cloud 为 Kimi Agent 提供服务的细节。指出 Agent infra 面向大众用户,要最小化 Agent 使用工具的摩擦,实现低成本。Kimi 与 TiDB 合作是范例,展现 Agent 基建的新趋势。