二元成功率」共找到 180 篇相关文章

新闻资讯8

AI 会取代你的工作吗?Anthropic 用 200 万对话告诉你答案

Anthropic发布Economic Index第四期报告,分析200万次Claude对话,提出“经济原语”框架。发现AI对高学历任务加速效果更好但成功率低,还揭示Claude.ai与API差异,引入“有效AI覆盖率”等。

宝玉AI
算法论文8

杜克大学、Zoom推出LiveMCP‑101:GPT‑5表现最佳但未破60%,闭源模型Token效率对数规律引关注

杜克大学与Zoom研究者推出LiveMCP - 101,这是针对真实动态环境的MCP - enabled Agent评测基准。含101个任务,实验显示先进模型成功率低于60%,研究为提升Agent能力提供改进方向。

机器之心
开源动态8

想入局VLA却不知从何下手?NTU&中大开源「终极菜谱」:从基座到频域建模,每一步都有实验支撑

MMLab@NTU联合中山大学的研究推出VLANeXt,从12个关键维度剖析VLA设计空间,每步有实验支撑。它在LIBERO及LIBERO - plus上超越SOTA方法,遇扰动成功率跃升10%,适合不同水平从业者。

量子位
产品应用7

国内首个!360发布“纳米漫剧流水线”,AI漫剧生成进入工业化时代

1月29日,360宣布国内首个工业级AI漫剧智能体生产平台“纳米漫剧流水线”公测。它整合多环节,素材生成成功率超90%,单集制作缩至1小时内,已和多家公司合作,推动构建行业标准。

量子位
算法论文8

推理与操控能力双提升!具身机器人双系统VLA模型新突破

香港中文大学等联合提出Fast - in - Slow(FiS - VLA)统一双系统VLA模型,实现快慢系统融合。在真机和仿真测试中,成功率和控制频率提升显著,泛化能力强。未来计划探索动态调参机制。

量子位
算法论文8

“这个怎么组装?”一句无害的问题,如何让AI产生危险输出

Amazon团队发现全新威胁模型“视觉排他性”,提出MM - Plan框架,通过强化学习训练智能体自动发现攻击策略。实验显示其对Claude 4.5 Sonnet和GPT - 5攻击成功率可观,代码和数据集已开源。

深度学习自然语言处理
算法论文7

700多个「坏模型」喂出AI测谎仪?Anthropic审计神器让AI自曝黑料

Anthropic故意训练近700个「有问题」模型,训了LoRA适配器(IA)让模型自报家门。IA在AuditBench平均成功率59%,但也存在幻觉、成本高、训练分布无指南等局限。

新智元
产品应用8

字节Seed发布PXDesign:蛋白设计效率提升十倍,进入实用新阶段

字节跳动Seed团队提出可扩展蛋白设计方法PXDesign,24小时生成数百高质量候选蛋白,效率较主流方法提升约10倍,湿实验成功率达20%–73%。还推出公开免费在线服务,提供配套工具加速应用落地。

量子位
开源动态7

AI 终于能"玩手机"了:Mobile MCP 让大模型直接操控你的 iOS 和 Android

Mobile MCP 是开源 MCP Server,让支持 MCP 协议的 AI 客户端操控 iOS 和 Android 设备,通过自然语言指令完成操作,解锁自动化测试等场景,但成功率有待提升,目前更适合探索性测试等。

AI Reading Hub
7

刚刚,Anthropic推出Claude Chrome插件,仅限1000人

Anthropic发布Claude for Chrome扩展,让Claude能在浏览器操作,仅向1000名Max计划用户开放预览。虽功能强大,但面临提示注入攻击风险。不过Anthropic有多层防护,降低了攻击成功率,并给出用户安全建议。

AGI Hunt