「基准构建」共找到 2657 篇相关文章
跨机器、物体与各种任务!RoboScience发布通用具身大模型
RoboScience机器科学发布Visics通用具身大模型并披露VLOA技术架构。该模型从底层搭建全新具身基础表征单元,适配任意机器人、物体和任务。其由具身世界模型和通用操作模型组成,有强大泛化和操作能力。
Google I/O 2026 | 开发者主题演讲精华集锦
在今年 Google I/O 大会上,谷歌发布 Gemini 3.5 系列模型,升级 '智能体优先' 开发平台 Antigravity,展示新工具和技能,助力开发者构建应用,还介绍了多项新技术及功能,另有招募活动。
LangFlow: 挑战离散扩散,探索下一代语言模型新范式
UIUC Ge Liu团队发布《LangFlow: Continuous Flow Matching for Large Language Models》,回归连续扩散架构。研究指出连续扩散受挫非先天缺陷,经优化,LangFlow让连续扩散在标准基准追平离散扩散,为多模态统一架构打通底层路线。
算力极限下,OpenAI 急着做什么?
OpenAI联合创始人兼总裁Greg Brockman接受专访,就产品战略收拢、新基座模型Spud等议题给出内部判断,回应业界质疑。他称产品调整是算力硬约束下的优先级排序,还透露了产品核心方向和Spud进展。
Routa 桌面版发布:内建 Harness 工程的 AI Coding 研发协作工作台
Routa桌面版发布,它是内建Harness工程的AI Coding研发协作工作台。围绕Routa构建Harness工程框架,Kanban成为任务协议,多Agent沿泳道接力协作,重新定义了‘done’,让AI Coding进入协作与交付问题域。
刷榜风波惊动OpenAI后,这家中国团队拿回Agent硬核榜单第一
在OpenAI主导的MLE - Bench基准测试上,百度伐谋2.0击败对手登顶。此前有团队刷榜引发风波,官方新增清洁赛道。伐谋2.0在多方面优化,还在汽车、金融、科研等产业落地解决难题。
科学家要失业了?GPT-5仅用18分钟解出黑洞方程,效率碾压人类数月!
2026年AI成科学家新战友,从破解优化难题到重现黑洞对称性,加速科学发现。数学家与ChatGPT合作完成证明,物理学者用GPT-5 Pro快速解黑洞方程,OpenAI还助力攻克生物学难题。
给 iPhone 装个“最强本地大脑”:Google 开源模型 Gemma 4
Google 4 月初发布开源模型 Gemma 4,可离线运行在 Google AI Edge Gallery 上。它在多项基准表现出色,采用 Apache 2.0 协议,开发者可集成到 App。还介绍了在 iPhone 离线使用方法及适用场景。
一句话生成无限逼真3D场景!匹兹堡大学新作直击VLM空间推理软肋丨CVPR'26
VLM在3D空间推理上表现不佳,且缺乏合适测试基准。匹兹堡大学团队提出InfiniBench框架,用LLM Agent迭代优化和聚类策略,可按需生成3D场景,还能精准定位大模型空间推理缺陷。
你敢把「龙虾」放在手机上跑吗?手机 Agent 离落地还差一道「隐私关」
港中深联合腾讯混元研究揭示,手机 Agent 落地关键不在成功率,而在隐私边界。研究设计隐私交互协议,构建模拟 App 记录过程,将常见越界行为归类检查,评估多个模型发现诸多隐私问题。