「安全评测」共找到 1493 篇相关文章
让模型“看视频写网页”,GPT-5仅得36.35分!上海AI Lab联合发布首个video2code基准
上海人工智能实验室等机构提出IWR - Bench评测基准,从“image - to - code”迈向“video - to - code”,对28个主流模型测试,最佳模型GPT - 5仅36.35分,指出当前模型短板,为研究指明方向。
国家定调「人工智能+」:中国AI十年三步走,战略解读来了
2025年8月国务院印发《行动意见》,为AI发展绘就至2035年蓝图。提出“三步走”,还聚焦模型、数据、算力、开源等方面发展,强调监管安全,体现中国AI发展新方向与治理新思路。
GPT-4o-Image仅完成28.9%任务!上海AI实验室等发布图像编辑新基准,360道人类专家严选难题
上海人工智能实验室等团队针对图像编辑AI提出问题,推出RISE任务及配套评测基准RISEBench。测试九个视觉编辑模型,结果显示当前模型完成复杂指令能力欠缺,闭源与开源差距大。
算不上AGI,但Anthropic发现了Claude的潜意识!
Anthropic可解释性团队新论文在Claude内找到“意识”与“潜意识”分水岭。用J - lens读取模型“想法”,经五组实验验证其类似人类“意识通达”结构,还涉及安全审计、反事实反思训练等内容。
OpenAI秘密矩阵曝光!你的所有设备,被Codex连成一台超级电脑
OpenAI将Codex升级为「超级控制平面」,可控制所有安装该应用的桌面设备,将其连成Codex网络。它有远程控制、多机上下文共享等功能,还能在锁屏时工作,但存在安全隐患。
开源首月斩获 1K+ star!大学生开发web终端工具,颜值高、功能强,真吊啊~
传统远程终端工具存在界面单一、功能有限等问题。大学生开发的开源Web应用Nexus Terminal,集成SSH等三大协议,有多重安全机制,适合中小团队运维等,开源首月获1K+ star。
无需任何 API 费用,这个Agent 拥有“看遍全网”的超能力
AI Agent 在网络信息获取上存在诸多难题,而 Agent Reach 能解决这些问题。它免费开源、安全且持续更新,兼容所有 Agent,支持多平台。安装简单,装好即可用,各渠道还能灵活替换。
OpenClaw长期记忆:优秀管线与玄学效果
文章拆解 OpenClaw 记忆系统全链路,指出其虽设计理念好,但记忆效果不稳定。介绍 RDSClaw 记忆插件如何补强,该插件与原生系统协作,提升记忆稳定性,在 LoCoMo10 评测中成绩显著。
突发!Meta 收购 OpenClaw 龙虾社交网络 Moltbook
Meta 收购给 AI agent 用的社交网络 Moltbook,其底层用 OpenClaw 框架,平台曾现安全漏洞。此前 Meta 还高价收购 Manus。但 Meta 想收购的 OpenClaw 被 OpenAI 抢走,社区对收购 Moltbook 反应不一。
Dario Amodei 万字长文:我们已经没有时间可以浪费了,直面并克服强大AI带来的风险
Dario Amodei万字长文指出,最早2027年或现超诺奖得主AI,人类面临安全威胁。他定义了“强大AI”,分析自主性、滥用、经济颠覆等风险,给出多方面防御措施,强调人类要直面问题。