「代码实验」共找到 2824 篇相关文章
T2R-Bench发布:业内首个由表格生成报告工业基准
为解决大语言模型将表格信息转化为报告的难题,研究团队提出“表格到报告”任务,构建双语基准T2R - bench,其涵盖多垂域表格,还设计评价指标体系,实验显示大模型在该基准上提升空间大。
图像编辑太慢太粗糙?全新开源自回归模型实现精准秒级修改 | 智象未来
AI图像编辑中扩散模型有两大难题,智象未来团队提出全新自回归图像编辑框架VAREdit,引入视觉自回归架构,提升编辑精准度与速度。模型和代码已开源,还提出SAR模块优化,在基准测试表现出色。
对话RoboScience邵林:VLOA大模型如何突破具身智能泛化瓶颈
本文对话RoboScience联合创始人邵林,探讨VLOA大模型突破具身智能泛化瓶颈。他介绍了模型优势、设计思路,对比VLA,还谈及范式、难点及落地场景等,强调以人中心、做有温度技术,重视模型落地。
一句话,性能暴涨49%!马里兰MIT等力作:Prompt才是大模型终极武器
马里兰大学、MIT、斯坦福等机构研究发现,AI性能提升一半靠模型,一半靠提示词。他们让DALL - E 2和DALL - E 3 PK,发现DALL - E 3性能提升中,模型升级贡献51%,提示词优化贡献49%。
Anthropic CEO:模型可在一亿上下文窗口中学习,且不改变权重,未来AI将每月10万美元
Anthropic CEO Dario Amodei预测几年内将出现月费10万美元、支持1亿词上下文窗口的AI模型。Google Research论文揭示LLM能在不改变权重下,通过「临时便签」机制学习,还介绍了其原理与实验验证。
Agent KB:经验池让Agents互相学习!GAIA新开源SOTA,Pass@1性能最高提升6.66
来自多家机构团队发布 Agent KB 框架,构建经验池实现 AI Agent 经验共享。在 GAIA 基准测试中表现出色,提升多模型 Pass@1 性能,还在软件工程领域展现价值。其设计精妙,经消融、检索策略等实验验证有效。
五倍推理加速,激发自回归潜能,苹果新工作让LLM预测未来
近年来自回归训练方法成语言模型主流范式,但推理阶段计算开销大。苹果研究人员开发框架,让预训练自回归大模型多 token 预测,代码和数学任务推理加速达 5.35 倍,一般任务约 2.5 倍。
如何实现可验证的Agentic Workflow?MermaidFlow开启安全、稳健的智能体流程新范式
随着大语言模型发展,多智能体系统成新前沿,「Agentic Workflow」受关注。但现有系统存在合理性难保证等问题。新加坡和南洋理工团队推出MermaidFlow,以Mermaid语言显式建模工作流,提升可解释性与可控性,实验性能优秀。
AI打假AI,拿下SOTA丨厦大&腾讯优图
厦门大学联合腾讯优图实验室团队提出AIGI - Holmes方法,创新性采用“大模型+视觉专家”协同架构,解决现有AIGI检测技术瓶颈,在检测、解释能力及鲁棒性评估上均取得最优效果。
“老程序员”为啥不迷信 AI 带来的效率提升?聊聊 AI 编码的局限与现实
开发经验丰富的人对AI编码提升效率更保守,因现有开发模式下,AI编程效率提升有限。特定场景AI给力,但项目复杂时提升迅速下降,还分析了原因,最后提到微服务架构或在AI编程时代重新火起来。