大模型安全评测」共找到 8381 篇相关文章

产品应用8

中国AI登顶全球之巅,顶流女团MV燃爆开场!AI音乐奇点已至

昆仑天工发布Mureka V8音乐大模型,基于MusiCoT技术,在音乐性、人声表现力和编曲层次等方面显著提升,使AI音乐达「可发布」级别,评测超Suno V5,还与太合音乐合作,欲打造全球AI音乐第一平台。

新智元
新闻资讯8

Ilya:扩展时代已经结束了,研究的时代已经开始

Ilya Sutskever 在播客访谈中深度探讨AI问题。他指出模型考试强但应用差,是因泛化能力不足;认为AI扩展时代结束,研究时代来临;还谈及AGI应是学习者,以及AI部署、安全对齐等观点。

宝玉AI
算法论文8

GAIR Paper 107|高校联合腾讯发布 GameCraft-Bench:AI已能端到端开发游戏,Claude Opus 四成达到可玩水平

香港中文大学(深圳)等高校联合腾讯发布 GameCraft-Bench,旨在构建基于真实游戏引擎、产物完整可运行且能验证的 AI 游戏生成评测基准,解决现有基准难衡量端到端可玩性的问题,测试显示前沿模型在游戏生成上仍薄弱。

AI科技评论
产品应用8

Kimi新出的Agent集群,到底有多恐怖?

Kimi发布K2.5模型及Agent集群功能,将国产AI推向“组织智能”新高度。K2.5全能且开源,多项评测优于GPT - 5.2 - xhigh且成本低。Agent集群可按需协调子Agent,实现“角色涌现”与“3D编排”。

newtype AI
推荐文章7

Vibe Coding 在代码生成与协作中的实践与思考

本文整理自阿里专家向邦宇的分享。探讨构建 Vibe Coding 工具,介绍其分类、在阿里现状。指出用户使用中面临代码质量等问题,产品自身有设计、安全挑战。还分享 Agent 建设经验,强调适配国产模型及模板化的作用。

InfoQ
算法论文7

基于Memory Bank的Cursor长会话记忆内存库理论研究与实践

文章围绕Memory Bank展开,介绍其为解决大模型长会话记忆瓶颈而设计的机制,包括存储、检索、更新模块。阐述其在编程和知识库建设的应用,还评测了Codelf等工具,指出Memory Bank是AI迈向智能的重要一步。

阿里云开发者
算法论文7

ICLR 2026 | 越推越快! 首个面向「Test-Time Scaling」的投机解码基准

文章指出推理阶段扩展(TTS)能提升推理大模型解决复杂问题的能力,但会产生大量冗余计算。为此提出首个面向TTS的投机解码加速综合基准,评测显示N - gram方法在特定场景加速潜力大,混合策略性能更优。

AI科技评论
新闻资讯7

全国首部可信AI“技术安全+数据合规”标准来了,欢迎参与起草!

2025年国家数据局开展可信数据空间试点,在多领域落地经验。但实践中出现技术与标准等问题,中国电子商会归口、智合标准中心组织起草《人工智能大模型可信数据协作安全与合规指南》,介绍标准内容、亮点等并征集起草单位和起草人。

AI寒武纪
产品应用8

阿里Qwen3一大波更新:代码生成、视频、图片、语音全都有

阿里Qwen3迎来一大波更新,涵盖多个模型。如Qwen3-Max在代码与智能体表现卓越;Qwen3-VL是强大视觉语言模型;Qwen3-Omni是全模态模型;还有图像编辑、同传、安全防护等模型及旅行规划师等应用。

AIGC开放社区
算法论文8

Meta打碎Transformer 8年铁律!改写AI最底层规则,模型首次冒出潜意识

Meta推出「自由Transformer」新模型,打破自2017年以来GPT模型核心规则,在解码器引入潜在随机变量Z,增加“潜意识”。仅增约3%计算开销,在多测试中超越大规模模型,或开启后自回归时代。

新智元