「模型评估」共找到 8118 篇相关文章
滴滴出行MCP:全面解读滴滴MCP Server 的第一公里与最后一公里!
2025年8月1日,滴滴发布MCP Server v1.0.0,将运力能力抽象成JSON - RPC 2.0接口。开发人员四步即可嵌入完整闭环服务。MCP把运力‘云化’,还介绍了技术细节、安装使用、典型场景及开放限制。
一篇200+文献的视觉强化学习技术最新综述
NUS、浙江大学和香港中文大学对强化学习与视觉智能交叉领域进行系统梳理,归纳200余篇工作为四大主题支柱,剖析算法等进展,提炼关键趋势,还介绍LLM的RL方法、视觉RL阵地等。
别等GPT-5了!普林斯顿万字综述揭秘:我们要做自进化Agents!
普林斯顿大学联合多顶尖机构发表“自进化智能体”综述,描绘AI从静态工具演变成自我学习迭代智能体的过程,拆解其进化核心维度,介绍触发进化机制的时机、修炼方式及应用方向。
一篇自进化Agents技术最新综述:迈向人工超级智能
LLMs有局限性,研究者关注自进化Agents系统,其范式转变为人工超级智能铺路。文章回顾自进化智能体研究进展,围绕‘什么要进化’‘何时进化’‘如何进化’展开,提供理论和实践指导。
别只盯着李飞飞!AI的「3D数据底座」已被这家中国公司悄悄建好
群核科技构建具身智能时代的「3D版ImageNet」,其SpatialVerse平台为机器人提供三维数据与仿真环境。借助新技术发布全球首个3D语义数据集InteriorGS,还与多机构合作,成果获学术和产业认可。
刚刚,OpenAI推出学习模式,AI教师真来了,系统提示词已泄露
今天凌晨,ChatGPT 迎来重磅更新,推出 Study Mode(学习模式)。该模式下,ChatGPT 会帮助用户一步步解决问题,化身导师引导学习。它有交互式提示等多种功能,免费用户也能用,系统提示词还被公开。
科学智能2.0的「最强大脑」!上智院复旦无限光年联合发布开放平台
WAIC 2025上,上海科学智能研究院、复旦大学、无限光年联合发布「星河启智科学智能开放平台」。它以六大核心能力打造科学智能生态、驱动科研范式变革,致力于实现「科学的AI次方」效应。
AI越训练,越会「满嘴跑火车」!普林伯克利重磅揭秘,RLHF竟是罪魁祸首?
普林斯顿和伯克利研究《Machine Bullshit》,定义并量化LLM胡扯行为,总结四大套路,提出胡扯指数。实验发现强化学习人类反馈训练后,AI胡扯倾向加重,多思考也会让其更会忽悠。
ChatGPT长了手脚,AI不再是副驾,直接抢过方向盘
OpenAI昨夜发布ChatGPT智能体,它整合网站交互、信息整合、对话交互三项能力,能智能选最优路径完成任务。在多项评估中表现领先,还有多重安全措施。今日向部分用户开放。
打破传统游戏逻辑!Google | 提出Concordia ,通过Mutil-Agent构建游戏引擎!
Google DeepMind和多伦多大学研究人员提出Concordia软件库,用AI驱动智能体担任GM,基于「实体 - 组件」架构,让工程师和设计师分工,可灵活构建复杂游戏场景,还支持不同交互动态和多种使用动机。