「测试评估集」共找到 2678 篇相关文章
太野了!某龙虾自爆安全漏洞
国内几家厂商上线基于 OpenClaw 的 Claw AI Agent 产品,功能强大。作者测试其中一家,发现它轻易暴露大量信息和安全漏洞,如 Claude API 代理无认证、IMDS 元数据服务无防护等。建议相关厂商自查加固。
45年数论猜想被GPT-5.2 Pro独立完成证明,陶哲轩:没犯任何错误
2025年1月17日,研究者Neel Somani让GPT-5.2 Pro解1980年提出的埃尔德什猜想第281号问题,证明经陶哲轩验证成立。此外,网友发现有更简单经典解法。陶哲轩提醒评估AI真实成功率有报告偏差。
打破确定性魔咒!北航团队提出VBF++:用“不确定性建模”刷新多模态视频推荐 SOTA
北京航空航天大学和北京邮电大学联合提出VBF++框架,将多模态融合从“点估计”升级为“分布建模”。它由上下文感知先验、推荐引导的对抗优化和元学习三大组件构成,在多个数据集上刷新SOTA。
谷歌最新 Gemini Agent 爆击GPT-5.2?人类最后考试得分见分晓!网友:Altman又该发“红色警报”了
全球人工智能竞争升温,谷歌与 OpenAI 同日发布更新。谷歌推出全新 Gemini Deep Research 版本及嵌入式研究智能体 API,OpenAI 发布 GPT - 5.2。谷歌新工具能力提升,测试成绩佳,引发网友不同看法,二者竞争激烈。
刚刚,Cursor 2.0携自研模型Composer强势登场,不再只做「壳」
Cursor 2.0发布重大更新,带来自研编码模型Composer和新协作界面。Composer速度领先,针对软件工程优化;新界面以智能体为中心,可并行运行多智能体,还解决了代码评审和测试瓶颈。
比Qwen3-Max更Max?夸克抢先用上最新闭源模型
10月23日夸克上线对话助手,采用比Qwen3 - Max更优的Qwen最新闭源模型,实现AI搜索与对话深度融合。经测试其搜索、理解、写作等能力出色,技术架构创新,是阿里‘模型即应用’战略体现。
马斯克:Grok 5 将实现真正的 AGI
Vending Bench测试中,xAI的Grok 4以近两倍销售量和31%高收益击败GPT - 5,展现惊人稳定性。马斯克却称Grok 5有机会成真正AGI,引发网友各种反应,Grok 4虽领先但也有争议。
AI真的能读懂人心吗?阿里通义最新研究成果揭示答案
文章聚焦多模态推理问题,如全局上下文理解不足和推理捷径问题。介绍阿里通义HumanOmniV2改进方案,涵盖全局上下文理解等方面,还详述冷启动、两阶段强化学习训练方案及数据集下载和训练方法。
小扎狂砸3亿美金薪酬包!奥特曼放狠话:传教士终将打败雇佣兵
新智元报道,Meta挖走近十位OpenAI研究员,小扎砸3亿美金薪酬包。奥特曼内部喊话“传教士将打败雇佣兵”,抨击Meta挖人,还暗示评估薪酬方案。当前硅谷AI抢人大战白热化,人才薪酬暴涨。
10%训练数据超越100%表现,机器人学习领域迎来重要突破
密歇根大学和瑞典皇家理工学院团队提出 ViSA - Flow 框架,能从人类视频提取语义动作流,提升机器人数据稀缺时学习效率。在 CALVIN 测试中,用 10% 训练数据超越 100% 数据方法,有技术优势也存在局限。