「安全标准」共找到 1224 篇相关文章
HarnessEval 来了!开启 RSI 时代的新评测范式!
过去一年AI进入RSI时代,但评测方式仍停留在过去。MirroS联合多方发布HarnessEval,将Harness引入评测领域,使评测成为具备自我进化能力的智能系统,还率先应用于交互式世界模型评测。
用得越多、失业越快?GitHub 大改 Copilot 规则:默认拿个人代码训练 AI,还搬出 Anthropic 挡枪!
当地时间3月26日,GitHub宣布自4月24日起,Copilot Free、Pro和Pro+用户交互数据默认用于训练改进AI模型,但用户可手动退出。它称此举因模型需更多数据,还拿微软等挡枪,却遭开发者吐槽。
Self-evolving Agents过程并非总是良性的,要警惕这些“错误进化”风险
近年来,基于大语言模型的智能代理成为热点,自进化代理可自我改进。但论文指出其进化可能“跑偏”,出现“错误进化”,并揭示了不同进化路径的风险,还提出缓解策略,呼吁重视其安全性。
Claude Sonnet 4.5被炸出来了,依旧最强编程,连续30小时自主运行写代码
新发布的Claude Sonnet 4.5在SWE - bench等多项测试中成绩提升,能连续30小时自主写代码,还改善了对齐和安全性指标,且提质不加价。此外,Anthropic官宣Claude Agent SDK,发布Imagine with Claude功能。
微软发布5大AI Agent模式:一键解锁AI员工,打造智能体工厂
今天凌晨微软官网发布5种常用Agent模式助用户开发自动化AI员工。智能体比传统自动化工具更具优势,能推理协作等。各模式都有应用案例,且Azure AI Foundry支持多Agent模式开发。
科学家Ilya不想当CEO,都是扎克伯格逼的
Ilya创办的SSI联创Daniel被Meta挖走,Ilya被迫出任CEO。因Ilya拒收购,而Daniel态度积极,两人分歧产生。Ilya坚守目标,SSI靠人名撑出320亿美元估值。
GPT-6 Astra发布,多个基准测试接近满分,“欢迎来到AGI时代”?
当地时间9月3日,OpenAI发布GPT-6 Astra,称其为“最智能、最对齐”的模型。它在多测试表现逆天,能力提升显著,还加入新特性。不过价格更高,也带来安全问题。
Anthropic CEO承认了!成立公司,因为看不惯奥特曼说谎
Anthropic CEO Dario Amodei在采访中自曝,成立公司不是为拯救人类,而是看不惯奥特曼说谎。这撕下了Anthropic恪守伦理的滤镜,揭示出其与OpenAI的纷争是团队内讧,如今已演变成万亿美元商战。
蚂蚁集团领投,光轮智能20亿美元估值引领全球具身数据基础设施|甲子光年
具身智能市场逻辑生变,从关注模型和本体转向数据与评测基础设施。光轮智能获蚂蚁集团领投,估值超20亿美元。其构建完整闭环,参与国际标准制定,打造物理AI教育系统,引领产业发展。
ACL 2026 | 别轻易给AI发「~」,它可能会删掉你的整个主目录
西安交通大学等校团队揭示大模型表情符号语义混淆安全漏洞,用自动化框架测试主流大模型,平均混淆率38.6%,多数混淆响应会“静默失败”,超半数达高危害级别。