表面安全对齐」共找到 1090 篇相关文章

开源动态8

Qwen全面升级非思考模型,3B激活、256K长文、性能直逼GPT-4o

Qwen全新非思考模型Qwen3-30B-A3B-Instruct-2507上线,仅激活3B参数,性能媲美顶尖闭源模型。相比前代,推理、对齐和长文本处理能力大幅提升,在通用能力上也全面进步,适合复杂人机交互应用。

量子位
新闻资讯8

Anthropic 完成930亿元 F 轮融资,投后估值达 13096亿

Anthropic 宣布完成由 ICONIQ 领投的 130 亿美元 F 轮融资,投后估值达 1830 亿美元。众多顶级投资机构参与,自推出 Claude 模型后增长飞速,业务覆盖多领域,资金将用于扩产、安全研究和国际化。

AI寒武纪
新闻资讯7

微信支付这波操作把我干懵了,Agent能赚钱?

微信支付从商业底层——支付——直接 mcp 了,用户可在腾讯元器体验其 mcp 服务,支付后智能体干活。微信支付 MCP 让 AI 与支付系统融合,实现“对话即交易”,但也面临安全合规问题。

MacTalk
新闻资讯7

AI幻觉成WAIC首个关键词,Hinton敲响警钟,讯飞星火X1升级展示治理新突破

今年WAIC上,‘幻觉’成热议词。诺奖得主Hinton、郑南宁院士等指出AI幻觉问题制约其可靠性与实用性。OpenAI等联手研究CoT监测保障安全。讯飞星火X1升级版在幻觉治理等方面取得进步,为可信AI提供佐证。

量子位
新闻资讯7

监管叫停外资收购Manus背后,有一个被忽视的关键问题|甲子光年

4月27日,国家发改委叫停外资收购Manus项目。该项目从2025年12月Meta宣布收购起备受关注。此次监管选择外商投资安全审查路径,预示AI时代监管侧重技术控制权,也可能加速VIE架构消亡。

甲子光年
开源动态8

9.8K Star!谷歌开源神器 OSV-Scanner,一条命令扫出所有依赖漏洞!

文章介绍谷歌开源的轻量级命令行工具 OSV - Scanner,它能扫描项目依赖中的已知安全漏洞,连接项目依赖与 OSV.dev 数据库。支持多语言、多包管理器,有多种功能,可离线使用,还能提供修复建议和许可证扫描。

开源星探
产品应用8

刚刚,Claude 5.1 发布!全球最强模型来了

Anthropic推出Claude Fable 5.1和Claude Mythos 5.1。Fable 5.1面向普通用户等,Mythos 5.1面向高风险领域伙伴。Fable 5.1性能优、价格低,在多测试中表现提升,还能用于科研,且安全防护机制升级。

机器之心
开源动态7

OpenAI没开源的gpt-oss基础模型,他去掉强化学习逆转出来了

OpenAI未发布gpt-oss基础模型,Cornell Tech博士生Jack Morris自行逆转gpt-oss模型强化学习,发布gpt-oss-20b-base。该模型可生成任意文本,但不再对齐,还测试了其记忆能力,介绍了诞生原理与技术细节。

机器之心
算法论文8

告别「边画边说」:LatentMorph 开启视觉生成隐式潜空间推理新范式

现有的文生图模型缺乏动态思考与自我修正能力,香港科技大学团队提出LatentMorph框架,将隐式潜空间推理集成到T2I生成过程中,实验显示其显著提升基座模型性能,削减推理延时与Token消耗,实现人机认知对齐

机器之心
8

【万字长文】Claude Skills完全指南:从概念到实战

这是万字Claude Skills指南,从概念到实战。介绍了Skills是模块化能力包,有渐进式披露设计,对比了与MCP、Subagent区别,阐述其优势。还讲了创建、设计、使用方法及分类体系,提示安全风险并推荐资源。

花叔