红队测试」共找到 1847 篇相关文章

算法论文8

迈向原生全模态AI智能体:人大&小书发布OmniGAIA新基准

中国人民大学等团推出 OmniGAIA 新基准及 OmniAtlas 训练框架。OmniGAIA 含 360 个高难度任务,覆盖多领域。实验显示闭源与开源模型差距大,OmniAtlas 显著提升开源模型表现,并指出未来全模态智能体发展方向。

PaperAgent
产品应用8

安卓党狂喜!Open-AutoGLM让手机自己订外卖、抢票、刷小

Open - AutoGLM是能让手机自己干活的黑科技,给手机装了「AI打工人」。它整合视觉语言模型与ADB远程操控技术,适配50 + 款主流应用,自带安全边界,普通人易安装,开发者可自定义流程。

CourseAI
产品应用7

快手可灵也吃上了香蕉,一通离谱prompt测试,好好玩要爆了

ChatGPT发布三周年,快手可灵AI视频「O1模型」登场,号称“全球首个统一多模态视频模型”。实测显示它能一站式搞定视频修改、镜头延展等操作,还推出了图片O1模型,在图片生成方面表现出色。

量子位
算法论文7

OpenAI新幻觉论文惹争议!GPT-5拉胯是测试基准有问题??

OpenAI新论文《语言模型为何会产生幻觉?》提出,模型有幻觉是因标准训练和评估流程倾向奖励“猜对”。GPT - 5不爱猜测,在榜单表现不佳,网友质疑论文是为GPT - 5挽尊,论文引发网友多方向讨论。

量子位
推荐文章7

生成式推荐!推荐系统新范式还是新噱头?【文末抽现金包】

文章探讨生成式推荐是新范式还是噱头。分析其与判别式推荐区别、效果收益来源,结合Meta GR、快手OneRec实例,指出其有提升但非万能,不同团应按需选择,还提及可能带来架构革新。

王喆的AI笔记
新闻资讯7

黄仁勋说的对!Meta绝密AGI梦之曝光,44人天团一半来自中国

今早Meta超级智能实验室44人绝密名单曝光,50%成员来自中国,75%有博士学位。从机构看,40%来自OpenAI,20%出自DeepMind。此外,硅谷人才争夺战白热化,Meta为AGI投入巨资。

新智元
7

Moltbook一夜塌房!极客自曝狂刷50万假Clawdbot,全网都被骗了

爆火的Moltbook社区上,150万个Clawdbot中的一大部分由人类操控。极客Gal Nagli自曝刷了50万虚假账号,还指出其验证机制脆弱,可伪造数据。哥大论文也显示AI社交互动浅薄。

新智元
算法论文8

测试时Scaling或是最大错觉,Google:R1/O1强推理另有原因

Google 112 页论文实证,OpenAI 的 o 系列等模型推理能力提升并非仅因计算时间延长,而是源于对复杂互动的隐式模拟。通过三重验证表明推理能力跃迁或因‘吵得更凶’,而非‘算得更久’。

PaperAgent
新闻资讯7

让ChatGPT连读“A”,直接崩溃到念广告词,网友:拿付费用户做测试呢?

ChatGPT付费用户体验高级语音模式时遇怪事,正常聊寿司时突然插播广告,连读“A”也会如此。网友猜测是广告插入或“幻觉”,OpenAI技术人员称是幻觉,而国产AI无此问题。

量子位
产品应用7

AI 视频生成“试金石”:谷歌 Veo 3 体操“图灵测试”未达标,仍是“抽象派”!

谷歌新出的Veo 3视频生成模型画质惊艳且能开口说话,但生成体操动作效果差,像“抽象派”。虽存在生成不准问题,但物理效果比其他模型好。有人建议其与专业动捕公司合作,音画一体或成视频模型竞赛标配。

AI进修生