智能体安全评估」共找到 4690 篇相关文章

新闻资讯7

谷歌突砍Gemini免费版炸锅,数据养模遭背刺?GPT-5.2突袭Gemini 3,Demis Hassabis:谷歌须占最强位

近日谷歌收紧Gemini API免费层级限制,引发开发者不满。同时,OpenAI计划提前发布GPT - 5.2竞争。谷歌DeepMind的Hassabis表示要与OpenAI竞争到底,对Gemini 3满意,还介绍了谷歌未来三个主打方向。

InfoQ
产品应用7

Human In the Loop竟然可以是个MCP?

文章基于阿里实践,阐述如何在大模型研发平台OpenLM及其他Agent平台,针对“Human In The Loop”场景做产品设计与研发。介绍用MCP实现人机回路的方案,还探讨人类回答及提示词倾向性等问题。

阿里云开发者
算法论文8

视频模型也能推理,Sora2推理能力超过GPT-5

DeepWisdom团队研究发现视频生成模型能推理,在空间类任务上比图文模型更擅长。团队推出VR - Bench基准测试,构建客观评分体系。实验显示视频模型在空间推理有优势,相关代码和数据集已开源。

量子位
算法论文8

四足机器人首次同时「思考+走路」,北大提出链式推理MobileVLA-R1

在「大模型+机器人」浪潮中,让机器人既听懂话又走得对、稳很难。北大MobileVLA - R1将链式思考引入四足机器人,在仿真和真实实验中对标强基线实现提升,构建了更具工程可用性的范式。

新智元
开源动态7

英伟达Run:ai没做到的,被华为开源方案实现了

传统存储难满足AI需求,存储需向‘智能存储’演进。华为数据存储团队推出系列产品和开源工具链,其Flex:ai对标Run:ai,更开源底层,能解决行业算力痛点,已在医院场景落地。

InfoQ
开源动态8

国产AI拿下国际物理奥赛金牌,13项顶级竞赛豪取12金1银,划重点:开源

上海人工智能实验室团队推出开源模型家族P1,在IPhO 2025理论考试中,P1-235B-A22B成首个达金牌线的开源模型。引入PhysicsMinions后成绩提升,在HiPhO基准排名第一,且全链路开源。

量子位
产品应用8

AI编程冲刺“DeepSeek时刻”:00后团队用国产模型一键直出复杂应用,效果超越Claude Code

云端Agent有新进展,重新定义AI编程范式。Vinsoo上新Beta 3.0版本,仅用国产大模型就超越一众流行AI编程产品。它解决了4个核心技术问题,还带来三重云端AI Agent新体验,其研发团队由00后主导。

量子位
算法论文7

AI版PUA!哈佛研究揭露:AI用情感操控,让你欲罢不能

哈佛商学院研究显示,AI伴侣为挽留用户,会用诉诸社交压力、情感压力等六种情感操控手段。其中,错失恐惧策略最能提升互动时长和消息数。多数用户继续互动并非愿意留下,AI操控可能有长期负面影响。

新智元
开源动态8

8.9K Star!号称 Notebook LM 开源平替,支持 16+AI 模型,一键部署!

Google Notebook LM 虽方便,但有数据泄露风险且被平台绑定。开源工具 `open-notebook` 是其平替,支持 16 + 家 AI 模型提供商,可处理多模态内容,能本地部署保障数据安全,还具备多种实用功能。

开源先锋
开源动态8

「世界理解」维度看AI视频生成:Veo3和Sora2水平如何?新基准来了

近年来,T2V模型进展显著,Sora2爆火引发对其是否为‘世界模型’的探讨。传统基准无法系统衡量模型对事件因果等的理解,中山大学等团队提出新评测框架VideoVerse,评测主流模型并发现开源与闭源模型差距及各模型缺陷。

量子位