能力暴露」共找到 3319 篇相关文章

算法论文8

北大伯克利联手“拷问”大模型:最强Agent也才40分!新基准专治“不听话”的AI分析师

北大与伯克利团队推出IDA - Bench新基准,模拟真实数据分析场景,解决现有基准无法评估大模型在动态交互中可靠性的问题。测试显示,顶尖大模型成功率最高仅40%,不同模型还暴露多种问题。

量子位
产品应用8

Claude Code 首席工程师揭秘 AI 如何重塑开发日常!

近日,Anthropic发布Claude Code首席工程师Boris与对外沟通负责人Alex的对话,揭秘Claude Code诞生、能力、技巧与展望。它可在终端辅助编程,适配多环境,还集成Claude Max套餐,新模型让其功能更强大。

AI科技大本营
新闻资讯7

金融大模型升级决策平台!马上消费发布“天镜”3.0破解经验碎片化难题

6月6日“2025消费金融生态大会”在重庆举行,马上消费常务副总经理蒋宁推出全面迭代的“天镜”3.0。它开启从个体到群体智慧跃迁,挖掘隐性经验,能匹配最佳服务路径,还具备协同进化能力

量子位
算法论文7

Adaptive Reasoning Model:Qwen3混合思考->字节AdaCoT->清华AdaThinking

文章介绍三种处理混合思考模式的方法,阿里 Qwen3 通过 SFT 让模型具备思考能力,但需人为控制;字节 AdaCoT 和清华 AdaThinking 让模型自主决定是否思考,分别用多目标优化和受限优化目标训练。

深度学习自然语言处理
产品应用7

用AI把一段视频变成可视化网页,Google的新模型又卷飞了。

Google更新Gemini 2.5 Pro至05 - 06版。此版代码能力在WebDev Arena盲测登顶,超Claude 3.7 Sonnet;还提升视频理解,可将视频转为可视化网页,虽有产品打磨问题,但进步值得肯定。

数字生命卡兹克
产品应用7

我是如何破解 NotebookLM 系统提示词的?

作者分享通过“逆向推理”破解NotebookLM系统提示词的故事,介绍系统提示词概念、破解原因、策略及从播客音频逆推提示词的方法,还提到该方法的效果及局限性 。

宝玉AI
新闻资讯9

换题还是第一!DM0.5横扫RoboColiseum四榜

本文报道原力灵机DM0.5在智元机器人发起的RoboColiseum具身模型评测中拿下四个单项第一,这已是该模型连续拿下六套不同类型公开评测的榜首,攻破了传统具身模型换题掉分的痛点,目前已开源落地产业场景。

机器之心
新闻资讯8

刚刚,GPT-6正式发布!OpenAI:欢迎来到AGI时代

OpenAI正式发布GPT - 6 Astra和GPT - 6 Astra Pro,宣布AGI时代开幕。该模型训练规模大,能力升级显著,价格公布。基准测试成绩优异,在多方面表现突出,还展示诸多实际应用案例,已有企业开始测试。

量子位
产品应用8

全球首个通用决策大模型,AI推演现实世界的技术揭秘

中科闻歌决策机Decitron被称为「全球首个通用决策大模型」,它将不同能力统一到开放世界决策框架,形成闭环。8月3日其技术报告发布,公开三项核心技术,还介绍了推演流程和实验验证情况。

机器之心
算法论文8

Facet-0:NTU王子为团队让机器人在精密装配中「看得懂、插得准、出错能恢复」

新加坡南洋理工大学PINE Lab团队研发Facet - 0机器人基础模型,用于精密装配。它在五项计算机装配任务中平均成功率达82%,能让机器人理解接触状态、判断对错并改进。通过多阶段训练,降低人工干预率,提高失败恢复率。

机器之心