「评估方法」共找到 2128 篇相关文章
滴滴出行MCP:全面解读滴滴MCP Server 的第一公里与最后一公里!
2025年8月1日,滴滴发布MCP Server v1.0.0,将运力能力抽象成JSON - RPC 2.0接口。开发人员四步即可嵌入完整闭环服务。MCP把运力‘云化’,还介绍了技术细节、安装使用、典型场景及开放限制。
安全噩梦:Docker 警告 MCP 工具链中存在的风险
Docker 发文警告,基于 MCP 构建的 AI 开发工具存在安全漏洞,如凭证泄露、代码执行等。MCP 协议发展快但部分实现有隐患,Docker 分析发现诸多漏洞,还提出强化方法应对。
AI越训练,越会「满嘴跑火车」!普林伯克利重磅揭秘,RLHF竟是罪魁祸首?
普林斯顿和伯克利研究《Machine Bullshit》,定义并量化LLM胡扯行为,总结四大套路,提出胡扯指数。实验发现强化学习人类反馈训练后,AI胡扯倾向加重,多思考也会让其更会忽悠。
真实物理加持,人物动画再也不像塑料人!UIUC华人让角色活起来了 | ICCV'25
PhysRig是UIUC与Stability AI联合提出的面向角色动画的可微物理绑定框架。它用物理建模替代传统绑定权重设计,解决传统LBS无法克服的问题,显著提升角色动画真实感,还适用于动作迁移任务。
ChatGPT长了手脚,AI不再是副驾,直接抢过方向盘
OpenAI昨夜发布ChatGPT智能体,它整合网站交互、信息整合、对话交互三项能力,能智能选最优路径完成任务。在多项评估中表现领先,还有多重安全措施。今日向部分用户开放。
打破传统游戏逻辑!Google | 提出Concordia ,通过Mutil-Agent构建游戏引擎!
Google DeepMind和多伦多大学研究人员提出Concordia软件库,用AI驱动智能体担任GM,基于「实体 - 组件」架构,让工程师和设计师分工,可灵活构建复杂游戏场景,还支持不同交互动态和多种使用动机。
UIUC提出隐式监督新范式:无需标注/RM即可全面提升多模态Reasoning的感知能力
大型多模态模型在复杂多模态推理中面临挑战,67%错误源于视觉感知缺陷。为此,UIUC提出PAPO,通过隐式感知损失提升模型感知能力,无需额外标注,在多模态基准上表现优异,还解决了KL黑客问题。
突破全模态AI理解边界:引入上下文强化学习,赋能全模态模型“意图”推理新高度
在多模态大语言模型应用多元的当下,对模型理解人类意图需求迫切。阿里巴巴通义实验室团队推出HumanOmniV2,解决现有推理路径问题,其相关代码等开源,在多基准数据集成果突破性领先。
集成20+先进算法,优于GPT-4o,自主因果分析智能体来了
加利福尼亚大学圣迭戈分校研究团队提出自主因果分析智能体 Causal - Copilot,集成超 20 种算法。它解决因果分析使用门槛高、预训练模型有局限等问题,性能优于 GPT - 4o ,已开源邀全球研究者参与。
你的衰老速度被科学家拍出来了| Nature子刊
Nature子刊研究推出新指标DunedinPACNI,不看身份证年龄,看“脑年龄”。其数值越高,脑功能衰退风险越高。该指标已开源,或助人们检测身体状况、调整生活方式。