「测试方法」共找到 3068 篇相关文章
模型宣称的“百万字处理能力”是真本事,还是营销噱头?LongCodeBench揭露真相
近年来大模型号称有百万字处理能力,但这是真本事还是噱头存疑。论文用LongCodeBench测评工具揭开长上下文模型真实表现,测试顶尖模型发现长文本能力‘翻车’,还分析了长上下文难的原因及面临的瓶颈。
Anthropic将在两周内推出新思考模型!
据The Information报道,Anthropic将在未来几周推出Claude Sonnet和Claude Opus两款新模型,能在「思考」和「工具使用」间切换,还可自动测试纠正代码。虽此前产品有不足,但新模型处理复杂任务更出色。
14B检索能力超过Google Search,阿里ZeroSearch通过RL激发LLM检索推理能力~
有效信息搜索对提升LLMs推理和生成能力重要,当前RL方法有文档质量不可控和API成本高问题。阿里通义Lab提出ZEROSEARCH框架,经多步骤训练,实验显示其在检索能力和泛化性上表现出色。
TreeHop:无需LLM的高效多跳问答新范式
多跳问答(MHQA)任务有挑战,现有方法依赖LLM,计算成本高、延迟显著。TreeHop研究提出新方案,摒弃LLM,通过嵌入空间动态更新,降低延迟、减少模型参数量,还在主流数据集表现佳,适合工业应用。
GPT-4o图像生成的「核燃料」找到了!万字长文拆解潜在变量,网友:原来AI在另一个维度作画
上月,GPT - 4o图像生成功能爆火。Sander Dielman在博客中探讨生成模型利用潜在空间提高效率和质量,将潜在变量比作「数据精髓」,深入对比多种模型,还介绍训练方法、损失函数等,兼具理论深度与直观洞察。
谢尔盖・布林再次进入「创始人模式」?Google押注「AI自我进化」
据路透社报道,Google联合创始人谢尔盖・布林深度介入AI研发,推动递归式自我改进(RSI)方向。此前Google新一代Gemini旗舰模型发布推迟,内部测试显示在关键领域落后对手,此次调整或为提升研发效率。
大厂的AI不限量补贴终会结束!Hermes Agent作者:开源框架真正的狠招是把Claude对Anthropic的忠诚抢过来
科技创作者 Peter Yang 对话 Hermes Agent 作者之一 Karan Malhotra,探讨 Hermes Agent 与其他产品的差异、模型谄媚问题、开源意义等。Karan 指出其独特自我改进系统与专注用户需求特点,还提及让模型更贴合用户的方法。
76%的性能提升与模型无关?Karpathy 700次 Loop 实验揭开 Agent 最大误区
前OpenAI联合创始人Andrej Karpathy警示业界重视模型框架。Hugging Face实验表明优化模型外层执行机制可大幅提升Agent性能,Karpathy开源项目揭示AI价值在循环迭代。还介绍了搭建持续进化Agent的方法及注意事项。
单次训练横扫9个基准,遥感检测最大数据集与基础模型框架问世
北京航空航天大学团队发布面向通用遥感目标检测的大规模数据集与基础模型框架 LEVIRDet,构建了 LEVIRDet - 159 数据集,提出 LEVIRDetNet 模型。前者为训练泛化能力强的模型提供新数据基础,后者在多基准测试中表现出色。
混元开源PhoneBuddy-4B与5篇系列论文:多项手机Agent真机评测超过GPT-5.4
腾讯混元Phone - use Agent团队发布PhoneBuddy - 4B及5篇系列论文。研究探讨如何训练真实可用的Phone - use Agent,采用Real + Mock方式,实验显示该方法提升效果显著,4B模型多项任务超GPT - 5.4。