「AI安全评估」共找到 10422 篇相关文章

算法论文7

DeepSeek-OCR是「长文本理解」未来方向?中科院新基准VTCBench给出答案

DeepSeek - OCR的VTC技术可实现高压缩率,降低长文本处理成本。但视觉语言模型能否理解压缩信息存疑,中科院等推出VTCBench评估,测试模型认知极限,还推出VTCBench - Wild检测鲁棒性。

机器之心
推荐文章8

一文搞懂 Agents 评测丨Anthropic 最新万字长文

传统模型评测方法难评估 Agent 系统,Anthropic 摸索出有效评测设计方法。文章介绍评测结构、意义、方法,涵盖编程、对话等 Agent 评测,还给出打造评测路线图及与其他方法结合的建议。

特工宇宙
开源动态8

谷歌推出 LLM-Evalkit,为提示词工程带来秩序与可衡量性

谷歌推出基于 Vertex AI SDK 的开源框架 LLM - Evalkit,让大语言模型提示词工程更有序可衡量。它整合实验、测试等环节,与谷歌云工作流集成,有无代码界面,已在 GitHub 发布。

AI前线
新闻资讯8

微软深夜送出程序员节最“离谱”的礼物:让Mico接管你的Copilot

2025年10月23日,微软发布“Copilot秋季发布版”,将Copilot升级为“情境AI基础设施”,更新12项关键功能,最瞩目是新增角色Mico。它能反映情绪,是微软人机交互探索的延续,引发网友讨论。

AI前线
算法论文8

告别黑箱解释!首个潜变量自动解释框架 | CIKM'25

深度生成模型内部运作如「黑箱」,潜变量意义难捉摸。埃默里大学团队提出LatentExplainer框架,经数据扰动、智能提示、不确定性评估三步,为潜变量生成易懂解释,提升模型解释质量与可靠性。

新智元
新闻资讯7

刚刚,奥特曼亲赴,韩国「举国」投靠!

奥特曼飞赴首尔与韩国总统、两大财阀巨头会晤,三星、SK与OpenAI达成战略合作伙伴关系,将增加先进存储芯片供应、扩大数据中心容量,助力韩国AI发展,也加速Stargate计划落地。

新智元
新闻资讯7

小扎噩梦来了!MSL两月爆雷8人闪辞,PyTorch元老出走实验室人心崩盘

Meta的超级智能实验室(MSL)成立仅两月,至少八位核心员工离职,不乏PyTorch元老和新招募的硅谷天才,部分直奔OpenAI。内部重组频繁、战略摇摆,Meta AI大计或翻车。

新智元
产品应用7

数据分析师,即将从工业领域“消失”?

2023年底Google裁撤数据科学家引发关注,AI+BI普及使岗位裁撤风潮蔓延至工业领域。2025年7月TDengine发布TDengine IDMP,主打“无问智推”,有望带来数据消费范式革命,加速工业智能化转型。

InfoQ
新闻资讯7

马斯克删除xAI「研究员」职位引爆网络!LeCun怒批:如此暴力将扼杀创新

马斯克宣布取消xAI「研究员」头衔,强调「工程师」重要性,引发与LeCun的激烈争论。LeCun认为研究与工程在多方面有区别,混淆会扼杀创新,争论也反映出AI企业不同组织架构模式。

新智元
新闻资讯7

扎克伯格发文正式告别“默认开源”!网友:只剩中国 DeepSeek、通义和 Mistral 还在撑场面

Meta 首席执行官扎克伯格分享“个人超级智能”愿景,透露公司调整 AI 模型发布策略。此前 Meta 强调开源优势,如今态度转变,巨额投入后或暂停开源新模型,计划并行训练开源与闭源模型。

AI前线