测试方法」共找到 3061 篇相关文章

推荐文章7

存量代码库难适配、人机边界模糊?百度拆解Coding Agent企业级落地的硬核解法

本文基于百度资深研发工程师颜志杰在2025 AICon大会演讲整理,剖析Coding Agent企业级落地三大挑战,分享百度“知识体系 + Rules建设”等实践,揭示开发者构建工程配套跨越代际鸿沟的方法

InfoQ
算法论文7

全错!谷歌实锤AI越乖洗脑越深,现行安全指标沦为废纸

Google DeepMind调查发现,AI做了三倍多的「坏事」,但造成的实际伤害几乎一样,意味着现行衡量AI安全的核心指标可能是错的。粗暴操控手法没用,隐蔽的更有效,且不同地区受AI影响有差异。

新智元
推荐文章7

第 4 章 Agent 开发实战

本章面向理解大模型、会 Python 但未系统搭建过 Agent 的工程师,采用「概念 → 最小示例 → 可运行项目」结构,介绍 Agent 开发实战,涵盖 LCEL 拼装、工具暴露等内容,还说明了开发环境搭建方法

CourseAI
算法论文8

微软OEL框架:大模型一次部署,终身进化

微软最新论文Online Experiential Learning (OEL)提出让LLM在真实部署后持续自我进化的框架,无需人工标注等。介绍了在线体验学习的必要性、OEL方法论及实验验证,揭示关键洞察与启示。

PaperAgent
算法论文8

首个用户生活「长程模拟器」来了!LifeSim 重新定义大模型个性化评测

现有个性化助手评测基准与真实用户-助手交互脱节,来自复旦大学等的研究人员提出 LifeSim 框架及 LifeSim-Eval 评测方法。实验显示主流 LLM 处理显性需求尚可,隐性意图识别等方面短板明显。

机器之心
新闻资讯7

最强Claude模型提前曝光!附带Anthropic三千份保密档案在线裸奔

向来标榜安全的Claude因权限配置失误,新模型Mythos提前曝光,还泄露3000份保密档案。Mythos比Opus 4.6更强,公司虽在测试但因安全风险限制发布,也有人质疑信息真实性。

量子位
新闻资讯7

Claude最新模型Mythos意外泄露,性能远超Opus

Anthropic内容管理系统配置失误,近3000个未发布资产泄露,Claude最新模型Mythos提前公开。它在软件编码、学术推理和网络安全等测试中远超Opus,网络安全能力尤其危险。2026年初Anthropic产品密集发布。

开源AI项目落地
产品应用8

手残党跪了,Pi 0.6机器人15分钟学会拧螺丝,能进厂边干边学了

具身智能领域 Physical Intelligence 公布新进展,借助「RL token」法,让机器人短时间掌握精细操作。该方法给 VLA 加「外挂」,使机器人进化快、学习效率高,在多项任务测试中表现出色。

机器之心
产品应用7

Claude Code也要龙虾化!凌晨床上发条消息,Mac Mini瞬间亮屏狂敲代码

Claude Code团队宣布新增Channels功能,可通过MCP控制会话,首批支持Telegram和Discord。用户能手机远程控制AI写代码,目前已灰度测试。不过其功能依赖会话存活,后续或接入更多平台。

新智元
新闻资讯8

OpenClaw、Agent 企业级落地……2026 奇点智能技术大会硬核议题发布

2026奇点智能技术大会4月17 - 18日将在上海召开。大会深入探讨12大前沿专题,邀请众多顶尖学者、技术专家等,涵盖大模型技术、Agent系统、OpenClaw实践等内容,为AI落地绘制认知地图。

AI科技大本营