测试框架」共找到 3137 篇相关文章

产品应用7

OmniWork:面向创作者的 Agent OS

文章介绍了面向创作者的 Agent OS OmniWork,它的 Agent 围绕专业方向定制,Expert 和 Skill 可自行创建,能多 Agent 协作。通过实例展示其从热点捕捉到生成 BP、文章创作等功能,还介绍了底层逻辑,适合创作人群。

AGI Hunt
产品应用8

Anthropic 那个“强到不敢发”的模型,终于来了!

今天凌晨,Anthropic 发布新模型 Claude Mythos Preview,它曾被指‘强到不敢发’。该模型能力跃升,尤其网络攻防能力突出,但因具‘双重用途’仅向少数伙伴开放,用于防御性网络安全项目。

InfoQ
产品应用8

跨越智能体落地的可信鸿沟:玄甲(AgentWard)全链路防御操作系统正式发布

大模型向自主智能体演进,安全威胁全域化。当前安全方案有局限,制约产业落地。清华大学团队推出玄甲全链路安全防御操作系统,构建五层纵深防御体系,已落地应用,降低安全事件发生率,筑牢安全防线。

机器之心
开源动态8

开源一周狂揽 7.6K Star!这个爆火的「同事.skill」可以将“数字遗产”炼成 AI!

开源项目colleague-skill上线不到一周获7600+ Star。它由@titanwings开发,可凭同事材料生成能替其工作的AI Skill,有双层架构、多源采集等亮点,还介绍了使用方法与项目结构。

开源星探
算法论文8

AI写CUDA算子准确率92%,到国产芯片只剩4%?上交方法直线拉升,DeepSeek也适用

GPT-5.2写CUDA算子正确率92%,给华为Ascend NPU写算子仅4%,因公开数据少等致‘新硬件冷启动’难。上海交大团队EvoKernel不训新模型、不标新数据,将GPT-5.2正确率从4%拉到83%,还拓展到DeepSeek架构算子。

机器之心
开源动态7

面壁智能开源 EdgeClaw,一款安全高效端云协同的龙虾 Agent。

当下AI Agent端侧常被忽视,数据任务都涌向云端致隐私泄露和算力浪费。近期面壁智能等联合开源EdgeClaw,以三级安全和性价比感知协同机制,解决OpenClaw数据泄露、token成本高等问题。

开源星探
新闻资讯8

OpenClaw绝配!GPT-5.4问世,AI能力开始大一统,就是太贵

周五凌晨,OpenAI 发布 GPT-5.4,引入原生计算机使用模式。它能操作软件、浏览网页等,性能和灵活性强,token 效率高,但价格贵。科学家认为 AI 前景广,有人觉得 GPT-5.4 Pro 达 AGI 级别。

机器之心
新闻资讯7

谨慎用OpenClaw:上海科技大学发布其全面安全体检报告

上海科技大学联合上海人工智能实验室对爆火的智能体OpenClaw做安全审计,在34个测试场景中,整体安全通过率58.9%,暴露出多方面问题,研究据此给出纵深防御策略。

AIGC开放社区
新闻资讯7

IMO题库“过时”了!OpenAI内部模型挑战最新First Proof,做了7天错了一半

谷歌发布Gemini 3 Deep Think爆火后,OpenAI用未发布内部模型,一周内尝试解答10道来自数学家科研现场的真实问题,5道基本正确。这些题取自真实研究,切断模型“背答案”可能,意味着自主推理能力进化。

量子位
产品应用8

字节豆包2.0重磅发布!成本暴降一个数量级,Seed团队揭秘视频Agent竞争关键

今天,字节正式发布豆包大模型 2.0 系列,围绕大规模生产环境需求优化,提供多款通用 Agent 与 Code 模型。其成本优势明显,多模态能力升级,未来将聚焦长链路智能系统构建。

AI前线