「测试方法」共找到 3068 篇相关文章
你不知道的 Agent:原理、架构与工程实践
文章聚焦 Agent 架构中影响工程效果的关键内容,如控制流、上下文工程等。介绍 Agent 基本运转方式、控制模式,强调 Harness 比模型更关键,还阐述上下文工程、工具设计、记忆系统等要点,并以 OpenClaw 为例说明落地方法。
跑分第一,推理暴跌!Claude Opus 4.7上线48小时口碑崩了
Claude Opus 4.7发布48小时口碑两极撕裂。官方榜单并列全球第一,但逻辑推理公开测试成绩暴跌,token消耗涨35%,旧接口报错,用户吐槽「更贵、更蠢、更爱顶嘴」,Anthropic虽解释却难平用户怒火。
港中文薛天帆团队:实现 4K 全景视频生成,普通视频也能「长出空间」丨CVPR 2026
香港中文大学薛天帆团队提出CubeComposer框架,可将普通视角视频扩展成原生4K的360°视频。研究在两个数据集测试,结果显示其在多指标上优于基线。该成果突破技术上限,让普通人也能制作360°视频。
让外部知识“长入”模型:动态化与参数化 RAG 技术探索
检索增强生成(RAG)成大语言模型利用外部知识主流范式,但传统方法将其当黑箱,忽略动态需求和机制鸿沟。艾清遥博士介绍动态化和参数化检索增强技术,可提升准确性与适应性,减少计算开销。
大模型记忆系统 MemOS 2.0:StarDust 技术演进与关键挑战|QCon 北京
4月16 - 18日QCon北京大会聚焦Agentic AI等前沿话题,记忆张量CTO李志宇将分享《大模型记忆系统MemOS 2.0:StarDust技术演进与关键挑战》,梳理技术演进,推出MemOS 2.0 StarDust,还分析实践痛点与演讲亮点。
求码10天,我终于过上了在微信上使唤🦞的日子
腾讯鹅虾产品QClaw升级,将微信入口变为小程序,支持传文件,上线灵感广场。作者求码10天体验它,测试其在微信和电脑端操作能力,肯定便捷性,也指出执行流程不透明等问题。
OpenClaw 最新必装10个Skills实战教程,真正做到养智能"小龙虾"
本文介绍2026年爆火的开源AI智能体OpenClaw,它能通过自然语言指令接管电脑执行复杂工作流。文章整理出10个必装Skills,涵盖实时搜索、网页自动化等场景,还给出安装方法、实战案例及常见问题解答,助用户搭建稳定环境。
震撼!OpenAI神秘模型连破6道前沿难题,奥特曼:AI在造「新知识」
OpenAI首席科学家爆料,其神秘内部模型一周攻克10道未发表顶尖数学难题中的6道。First Proof团队用公开模型测试,结果冷峻。虽OpenAI实际命中率或低于宣称,但AI解前沿题意义重大,也暂无法取代数学家。
DeepSeek-OCR 2再进化,对图像理解已经像人一样逻辑推理了
DeepSeek-OCR 2升级,保持前代高效压缩率和解码效率,引入DeepEncoder V2,模仿人类视觉因果流机制,将图像理解转为逻辑推理,在文档解析领域实现逻辑重构,性能显著提升。
OpenAI开启“印钞机”模式?ChatGPT官宣引入广告,新增8美金/月Go版低价订阅服务
OpenAI宣布广告业务要来了,其低成本订阅服务ChatGPT Go将登陆美国及所有ChatGPT可用地区。未来几周将在美国免费版和Go版中测试广告,Pro、Business和Enterprise订阅方案无广告。还明确广告业务五大原则。