「Agentic软件测试」共找到 4555 篇相关文章
太强了!这个 NotebookLM Skill,真的把 NotebookLM 搬进了命令行!
Google的NotebookLM凭借强大模型能力成AI圈“现象级”产品,如今开发者将其搬到命令行,开源神器notebooklm - py诞生,具备AI Agent工具、研究自动化等功能,有多种使用方式。
这个框架让大模型省下50%内存,合并专家不如直接删掉?
Cerebras Research提出REAP框架,通过专家剪枝和合并技术压缩SMoE模型,能让模型‘瘦身’并保持性能,可省50%内存,但社区测试有不同结果,且存在调度开销等问题。
Feishu OpenAPI MCP 工具深度解析:AI代理与协作平台的无缝集成!
文章深度解析飞书OpenAPI MCP工具,它能实现AI agent与飞书开放能力集成。介绍其功能、特点,以Trae为例讲安装使用步骤,还列举初始化表格、创建群聊等典型案例。
一年上线超 10 款产品,AI 时代如何做独立开发
ThinkAny&MCP.so 创始人艾逗笔分享独立开发感悟与经验,介绍多款 AI 产品,如 ThinkAny、ShipAny 等。还给出 AI 应用出海 SOP、可 all in 的创业方向,如 AI Coding、Agent 等,为开发者提供参考。
刚刚,马斯克发布Grok 4!全榜第一,年费飚到2万+
北京时间中午,马斯克现身 xAI 发布会发布 Grok 4,称其是世界最好的 AI。Grok 4 推理能力强,多类基准测试成绩领先,还在多方面能力获加强,已上线但付费昂贵。
确认!DeepSeek多模态AI已经开测
DeepSeek研究员陈小康、陈德里确认其V4视觉模式开始灰度测试。更新后出现识图模式,具备真实图像理解能力。陈小康是多模态研究组负责人,陈德里负责语言模型等核心方向,V4可谓满血归来。
成本降九成,准确率100%!MIT反常识架构挑战硅谷信仰
慕尼黑工业大学等研究者指出企业AI落地问题源于数据乱。RUBICON架构用AQL查询语言,把操作权交用户,让LLM在精确范围工作。测试中它准确率100%,成本低,优于现有智能体AI方案。
UniPat AI开源SWE-Vision:五百行代码打造SOTA视觉智能体!
多模态大模型代码能力进步大,但基础视觉任务常失误。UniPat AI开源SWE-Vision框架,让模型用Python代码处理视觉判断。它极简设计,在五个视觉基准测试达最优,提升前沿模型视觉表现。
规范对齐时代:GPT-5 断层领先,让安全与行为边界更明晰
上海交通大学等团队提出规范对齐概念,构建评测基准 SpecBench 评测 33 个主流模型,发现多数模型有不足。还探索测试时深思方法,如 Align3 能提升规范遵循度,GPT - 5 在规范对齐上断层领先。
DeepSeek R2没来,DeepSeek R1+来了~
DeepSeek官方发布通知,DeepSeek R1模型完成小版本升级成DeepSeek - R1+。PaperAgent实测近1000行代码无错,网友测试显示CoT有显著变化、前端审美提升,还提及DeepSeek - R2可能快来了。