「安全挑战」共找到 1907 篇相关文章
用「进化+压力测试」自动生成的竞赛级编程题,各家大模型谁更hold住?
北京大学与通用人工智能研究院联合提出 UniCode 框架,构建进化式评测系统,能自动生成高质量算法题目与抗污染测试用例。通过对 19 个前沿大模型测试,展现高挑战性与强判别力,为代码能力评估开辟新路径。
OpenAI的新浏览器实测被吐槽疯了?走“乔布斯风”、挖谷歌骨干,奥特曼就“复制”出个ChatGPT版Chrome?
OpenAI发布全新网页浏览器ChatGPT Atlas,战略上欲让浏览器成操作系统演进形态。它整合ChatGPT,有诸多创新功能,虽对谷歌构成威胁,但实测被吐槽,且智能代理浏览器带来新安全风险。
基础模型已颠覆科研,进入第五范式!港科大综述113篇论文 | NeurIPS'25
港科大论文指出,随着科学问题复杂度提升,传统科研范式显露出局限。基础模型(FMs)横空出世,具备通用性、规模与知识覆盖、推理与生成能力,可能引领科学进入第五范式,但也面临偏见、幻觉等问题。
250份文档就能给大模型植入后门:不分参数规模
Claude母公司Anthropic联合英国AISI和图灵研究所研究发现,仅250份恶意文档就能给不同规模大模型植入“后门”漏洞,打破了以往对大模型数据中毒的认知,给厂商提了个醒。
2025 年 InfoQ 趋势报告:AI、ML 和数据工程
InfoQ AI ML 趋势报告基于编辑团队与嘉宾播客,总结 AI、ML 技术发展趋势。涵盖 AI 代理、多模态语言模型等创新领域,也提及早期采用者、早期多数、晚期多数类别的技术,还对 2025 年相关领域发展作出预测。
6.1k星星!这个开源 AI 知识库火了。附教程,简单且实用。
知识管理是刚需,因数据安全问题,本地部署的开源知识库受关注。本文推荐PandaWiki,它是AI驱动的开源知识库搭建系统,安装部署简单,功能丰富,适用于企业和个人。
图灵得主Yoshua Bengio,开始警惕AI有意识了
图灵得主Yoshua Bengio和学生在Science发文探讨AI意识问题。文章未明确AI是否有意识,而是讨论科学界和公众信念的演变及把AI当有意识生命体的风险,还提及计算功能主义等相关理论。
华为发布如何利用RL训练强大的Deep Research Agent综述!
华为技术团队发布综述论文,首次系统性梳理利用强化学习(RL)训练强大的深度研究代理。论文指出传统SFT和DPO方法有局限,RL优势明显,还在数据构建、算法设计等方面给出进展与路线图。
大突破!实验证明,RL能为LLM注入“创新”能力
此研究挑战‘RL不教新技能’观点,通过‘字符串转换预测’实验证明,RL能让LLM学会组合已有原子技能,形成可泛化、迁移的元技能,还给出模型能力提升路径。
OpenAI和Anthropic罕见互评模型:Claude幻觉明显要低
OpenAI和Anthropic罕见合作,互相授予API权限评估模型安全与对齐情况并发布报告。双方派出多模型参与,从指令层次、越狱、幻觉、欺骗策略等方面评测,呈现各模型优缺点。