测试全流程」共找到 3880 篇相关文章

开源动态8

AI智能体也有「蜘蛛感应」,防御延时骤降至8.3%

传统Agent防御机制易致延时积累,研究者联合推出Spider - Sense智能体防御框架,利用两大核心技术将防御延时从200% + 降至8.3%,在主流数据集和新基准测试中表现优异。

新智元
算法论文8

Nature新研究:AI竟然分不清事实和信念

斯坦福大学团队在Nature发表研究,测试15个大模型,发现其区分事实、信念和知识存在严重缺陷。如处理第一人称信念准确率低,对语言线索依赖高,在高风险领域应用令人担忧。

AI工程化
推荐文章8

最权威的Skills编写指南来了!33页,Anthropic亲自发布

Anthropic发布33页《Skills编写完整指南》。Skills能为智能体注入行业经验与工作流,实现复杂任务自动化。指南梳理了编写逻辑,涵盖定制、构思、测试、发布等生命周期内容。

AIGC开放社区
8

清华传奇姚顺宇立功!新Gemini一夜血洗编程,球仅7人能赢它

谷歌Gemini 3 Deep Think重磅升级,几乎刷爆领域SOTA。编程界冲入Codeforces人类TOP 10,人类最后考试等测试也表现优异。还能解决科研工程难题,实测物理模拟能力强,给OpenAI带来压力。

新智元
开源动态8

中科院开源PPT Agent,一键自动生成PPT智能体

中科院软件所等联合开源PPT Agent,它能分析参考幻灯片,按人类流程分两阶段生成PPT,有自我修正功能,测试显示在多维度优于现有方法,极大节省用户时间精力。

AIGC开放社区
新闻资讯7

美国2月9万裁员狂潮,超过去一年!亚马逊甲骨文成最大刽子手

2026年2月美国已裁9万个岗位,超2025年年。亚马逊、甲骨文、Block等公司因AI裁员,如甲骨文为建数据中心,亚马逊为“去官僚化”。AI重写用人公式,威胁流程型白领等三类人。

新智元
新闻资讯8

Anthropic深夜连放两弹:Sonnet 5、新AI科研App重磅上线

Anthropic 深夜发布两个重磅更新:Claude Sonnet 5和面向科研人员的AI工作台Claude Science。Sonnet 5性能接近Opus 4.8,提升Agent能力且价格低;Claude Science整合科研工具,支持复现产出、自动管理算力、多学科查询。

AI寒武纪
新闻资讯7

谨慎用OpenClaw:上海科技大学发布其面安体检报告

上海科技大学联合上海人工智能实验室对爆火的智能体OpenClaw做安审计,在34个测试场景中,整体安通过率58.9%,暴露出多方面问题,研究据此给出纵深防御策略。

AIGC开放社区
开源动态8

大模型首次直接理解代码图:不用Agent自动修bug,登顶SWE-Bench开源模型榜单

蚂蚁开源新模型CGM,首创将仓库代码图模态融入大模型,不依赖闭源模型和复杂Agent,仅需4步就能快速定位、生成补丁。它在多个测试基准中领先,技术论文等均已开源。

量子位
产品应用8

CapCut Mate:开源剪映自动化神器,让AI替你剪视频!

CapCut Mate是开源免费的剪映草稿自动化助手,让开发者通过API控制剪映核心功能,效率提升超100倍。它功能丰富,覆盖剪辑流程,适用于多场景,还提供三种使用方式。

小华同学ai