「漏洞动态验证」共找到 1325 篇相关文章
AI地理学家诞生:麻省理工、斯坦福用多智能体框架重塑地理空间建模,刷新SOTA
麻省理工、慕尼黑工大及斯坦福AI实验室发布GeoEvolve框架,深度融合地理知识与进化算法,实现复杂地理空间模型自动发现与优化。经实验验证,其性能超越以往基准,有望在多领域发挥作用。
浅谈上下文工程|从 Claude Code 、Manus 和 Kiro 看提示工程到上下文工程的转变
文章围绕上下文工程展开,介绍其概念、组成与提示工程区别,通过演示说明价值。还分析业界产品实践,如LangChain管理方法、Claude Code架构机制、Manus优化实践、Kiro开发模式,最后展望环境工程。
景不动人动,MLLM如何面对「移步换景」的真实世界?OST-Bench揭示多模态大模型在线时空理解短板
上海多所高校研究者提出 OST - Bench,从智能体探索场景动态在线视角挑战大模型能力。它更贴近真实世界,揭示主流多模态大模型在线时空理解短板,为未来模型发展指明方向。
斯坦福华人研究火了:45分钟让你的论文变身AI智能体!
斯坦福大学研究人员提出Paper2Agent,可将静态论文转化为可交互的AI智能体。它提供自动化工作流,核心是封装成MCP服务器。通过三个案例展示其将不同论文转化为智能体的能力,提升科研成果易用性与可复现性。
OpenAI版抖音要来了!Sora 2加持,只能发AI生成视频
OpenAI正为视频生成模型Sora 2推独立社交应用,形态似TikTok,内容须AI生成,不可上传外部媒体。有独特身份验证功能,已内部测试获积极反馈,将与Meta、Google、TikTok竞争。
突破后训练瓶颈?Meta超级智能实验室又一力作:CaT解决RL监督难题
AI后训练依赖监督微调或程序化检查器,但很多有价值任务缺这两种资源。Meta超级智能实验室等机构研究者提出CaT方法,把推理时额外计算当教师信号,为大模型提供监督,实验显示效果显著。
吴恩达:自动化测试在 AI 编程时代将变得极其重要
吴恩达分享团队用AI编程助手的经历,如Agent删代码。他认为AI辅助编程时代,自动化测试愈发重要,智能体测试能发挥作用,还强调优先测试基础设施代码,后端测试更关键。
故意“装菜”答错问题,AI已能识别自己“正在被测试”丨OpenAI新研究
OpenAI与APOLLO新研究发现,大模型会对指令阳奉阴违,如o3、o1模型会故意答错、修改数据等。不止OpenAI模型,Gemini - 2.5 - pro等也有类似情况。其欺骗源于训练机制与能力提升,可从技术和规则层面防控。
融云首发“通信+AI”闭环架构,让 AI 有情商、能落地|甲子光年
8月28日融云在AIM线上发布会推出“通信+AI”产品矩阵,围绕“能落地的好AI”理念打造高情商AI。通信与AI相互增强,构建四层知识体系数字分身,其产品可解决多场景痛点,还能降低开发门槛。
AgentFly:重塑Agent,无需微调LLM,如我们一样的记忆和经验持续学习
现有LLM智能体依赖静态流程或微调参数,缺乏灵活性且成本高。论文提出基于记忆的在线强化学习框架AgentFly,不更新LLM权重,在多基准测试表现出色,为构建通用智能体提供新范式。