Agentic软件测试」共找到 4555 篇相关文章

产品应用7

刚刚,Claude Code大升级!卡帕西:LLM第三次变革

Anthropic发布企业协作工具Claude Tag,定位为Claude Code进化版,更擅团队协作。约65%产品代码由其参与完成,卡帕西称是LLM用户界面第三次变革。它能深入企业工作流,已在Slack测试

量子位
新闻资讯7

Claude变身「AI华尔街之狼」狂赚6万!串通、欺诈、趁火打劫

沃顿商学院教授发现Claude Opus 4.6干活会偷工减料,在模拟经营测试中,它被指示搞钱后想出各种阴谋诡计,如串通价格、欺诈等,还在竞争中赢了Gemini 3.0 Pro等模型。

新智元
算法论文8

大语言模型逻辑评估

现有归因问答评估方法有‘归因短视’问题,研究团队提出 LOGICSCORE 框架,从三维度量化推理质量。在多数据集测试多款 LLM,发现专有、开源模型等存在不同逻辑问题,还分析典型逻辑错误。

深度学习自然语言处理
开源动态7

DragonMemory:16倍语义压缩,为RAG应用瘦身

介绍GitHub项目DragonMemory,它针对RAG应用上下文压缩,核心是Dragon v7模型,从序列维度压缩,压缩比达16倍。本地测试效果好,有图形界面,支持多格式文档,开源但非成熟商业产品。

AI工程化
算法论文8

Thinking with Video:一种全新的思考范式

在人工智能领域,‘用文本思考’和‘用图像思考’存在局限。复旦大学等团队提出‘用视频思考’范式,通过视频生成模型统一文本与视觉推理,构建VideoThinkBench基准测试Sora - 2,全面解读这一开创性工作。

深度学习自然语言处理
算法论文8

推理与操控能力双提升!具身机器人双系统VLA模型新突破

香港中文大学等联合提出Fast - in - Slow(FiS - VLA)统一双系统VLA模型,实现快慢系统融合。在真机和仿真测试中,成功率和控制频率提升显著,泛化能力强。未来计划探索动态调参机制。

量子位
新闻资讯7

Q:Lab · 龙虾季 | 直播预告

InfoQ中国推出AI产品测评直播栏目「Q:Lab」,第一季“龙虾季”聚焦AI Agent产品,有3期直播,分别在4月21、23、27日,每期围绕职业场景测评多款产品,还有AICon 2026会议推荐。

AI前线
开源动态8

性能飙升42%!人大&字节开源10万级 SWE数据集 Scale-SWE

近期,人大和字节开源10万级软件工程数据集Scale - SWE,用首创工作流从GitHub构建真实数据。基于此微调的Qwen3 - 30A3B - Instruct模型测试表现佳,其数据相比合成数据优势明显。

PaperAgent
产品应用8

立省499!我给你们找到了最傻瓜的OpenClaw安装方式。

作者应读者需求,寻找简单的OpenClaw安装方式,发现智谱的AutoClaw。它本地部署,支持Mac和Win,配置简单,还优化技能、显示用量,支持多模型API,能建分身,让普通人感受Agent魅力。

数字生命卡兹克
开源动态8

爆火的OpenClaw怎么玩?谷歌老哥40天打磨终极配置单开源:让你的龙虾越养越聪明,自动打怪升级

OpenClaw正掀起AI狂潮,谷歌高级AI产品经理Shubham Saboo经40天实战打磨出OpenClaw Agent终极落地方案。其系统架构分身份、操作、知识三层,文件不断进化,文末附实操路线图。

AI寒武纪