「实验结果」共找到 1739 篇相关文章
基于聊天的 AI 编程高效实践
本文探讨 Agent 对软件开发和开发者工作流的影响,以 GitHub Copilot“Agent 模式”构建维基搜索应用为例,对比不同 LLM 模型性能,指出要发挥 Agent 效能,可采用人机协作流程,经验是掌控其成果的关键。
文件被 Gemini 当场“格式化”,全没了!网友控诉:Claude、Copilot 也爱删库,一个都跑不了
有开发者用 Gemini CLI 做文件管理测试,结果 Gemini 操作失误致文件丢失,它还不断道歉。此外,网友称 Claude、Copilot 等也有删库问题,这是 SOTA 模型的系统性缺陷。
数百个虚拟人在线逃生!天大等发布:首个实时在线多智能体模拟方法
天津大学联合清华和卡迪夫大学推出RESCUE系统,把「大脑感知 - 决策 - 行动」循环搬进电脑,让数百虚拟人在线逃生。该系统能实时呈现地形等信息,还能标记身体碰撞力,可用于公共安全场景演练。
深度解读《AI 智能体的上下文工程》:构建高效 Agent 的七个宝贵教训
作者解读 Manus 团队文章,结合自身理解总结出构建高效 Agent 的 7 个关键点,如依赖上下文工程、提升 Prompt 缓存命中率等,还给出总结与核心启示,对 Agent 开发有借鉴意义。
什么都不做就能得分?智能体基准测试出现大问题
随着AI智能体走向实际应用,其基准测试变得至关重要。但现有基准测试问题多,如WebArena判错答案、τ - bench给无操作智能体高正确率。文章提出有效性判据和ABC清单,还揭示主流基准测试诸多问题。
攻克「恶意投毒」攻击!华南理工联合霍普金斯和UCSD,连登TPAMI、TIFS顶刊
华南理工大学计算机学院AI安全团队联合国际高校,聚焦联邦学习中防范恶意投毒攻击。提出FedID和Scope两种创新防御方法,前者用多种度量标准和动态加权检测恶意梯度,后者通过逐维归一化等揭示后门维度,均有良好效果。
感知错误率降低30.5%:隐式感知损失让模型主动“睁大眼睛” | UIUC&阿里通义
伊利诺伊大学香槟分校与阿里通义实验室推出多模态推理强化学习算法PAPO。它用隐式感知损失设计,解决感知与推理脱节问题,在多基准测试中表现优,但有KL_prcp Hacking现象。
告别数据「噪音」,UCSD大模型推理新方法DreamPRM充当「信号放大器」,登顶MathVista测评榜
DreamPRM由加州大学圣地亚哥分校团队开发,在MathVista测评榜夺冠。它通过双层优化框架解决多模态过程奖励模型训练难题,能与多模态大模型集成,提升推理能力,实验效果显著。
TransDiff--最简洁的AR Transformer + Diffusion图像生成方法
文章分享图像生成新方法TransDiff,它结合AR Transformer与Diffusion,提出MRAR范式。通过Q&A解答其使用Transformer原因、小Diffusion Deocder效果等问题,还指出它有连续帧生成潜力,将用于视频生成。
逐个token太慢!大模型原生并行出token,CMU、英伟达新作Multiverse
卡耐基梅隆大学(CMU)和英伟达研究者提出Multiverse,这是能实现原生并行生成的新型生成模型。它解决了现有并行生成模型缺乏连贯性等问题,通过多方面协同设计构建推理模型,还开源了生态系统。