「多模态提示框架」共找到 2825 篇相关文章
在失败中进化?UIUC联合斯坦福、AMD实现智能体「从错误中成长」
伊利诺伊大学厄巴纳 - 香槟分校等团队发布论文,剖析LLM智能体失败机制,提出可自我修复的创新框架AgentDebug。研究指出智能体常见失败类型,构建错误分析体系、数据集,实验显示该框架效果显著,为AI可靠性提供方案。
死磕即梦48小时,我发现了AI公众号封面的懒人密码
作者与即梦Agent死磕48小时,分享AI公众号封面制作经验。介绍垫图法、两个提示词模板,测试提示词反推、语义理解等功能,指出不足,认为即梦像AI作图界拼多多,瑕不掩瑜。
我写了个 Skill,让 Agent 自动给文章配图
作者写了个 Agent Skill 实现自动给文章配图,介绍了 Agent Skills 概念、与传统提示词和 MCP 的区别,阐述配图 Skill 设计思路、SKILL.md 写法、提示词模板设计、工作流程等,还分享了设计选择和使用方法。
用中等难度prompt做高效post training
近年来,RL后训练在LLM发展中至关重要,但传统方法效率低。本文提出PCL轻量级算法,通过动态选中等难度提示提升LLM后训练效率,经多基准实验验证其优越性,也指出方法局限与未来方向。
合成数据>人工数据,绝对性能暴涨超10个点!仅需任务定义,高效微调大模型
为解决基础模型在专业领域表现不佳、依赖人工标注数据的难题,北大、MIT等机构提出「合成数据强化学习」框架。该框架仅需任务定义,能生成合成数据微调模型,在多领域基准上性能提升显著,代码已开源。
腾讯开源混元Image 2.1:2K高清+完美文字嵌入,图文天花板来了
今天凌晨,腾讯开源最新图像模型混元Image 2.1,支持原生2K分辨率与长提示词,文字嵌入能力强,适用于专业场景。还开源加速版模型权重和提示词改写模型,评估显示其性能达开源最优,接近闭源商业模型。
OpenAI久违发了篇「正经」论文:线性布局实现高效张量计算
OpenAI 近日发布研究论文,提出用于高效张量映射的统一代数框架 Linear Layouts,解决了 Triton 等深度学习编译器中长期存在的难题。该框架是使用二元线性代数的张量布局通用代数形式,评估显示其优化版 Triton 性能有提升。
大道至简,何恺明团队新作pMF开启像素级「无潜、单步」生成范式
何恺明团队新论文提出用于单步、无潜空间图像生成的pMF框架,直指主流扩散与流匹配模型通病。该框架将v、u和x三个场关联,训练网络把噪声输入直接映射为图像像素,实验表现强劲。
AI coding 智能体设计
文章从分析Gemini - CLI源代码入手,解读AI coding工具智能体设计。涵盖用户提示词预处理、工具注册与调用、架构设计、预置提示词等内容,还对比了Gemini - CLI和Claude Code可扩展性设计,介绍规约驱动开发模式。
交互扩展时代来临:创智复旦字节重磅发布AgentGym-RL,昇腾加持,开创智能体训练新范式
强化学习之父指出人工智能迈入「经验时代」,在此背景下,复旦、创智、字节研究者发布 AgentGym - RL 框架。它是全新端到端 RL 框架,提出 ScalingInter - RL 方法,7B 模型经训练追平顶尖商业模型,为 AI 发展注入动力。