「数据生成方案」共找到 4885 篇相关文章
大模型微调评测入门:看懂这些指标,才知道模型好不好
文章指出大模型微调中很多新手重“调”轻“评”,评测是决定模型落地的关键。介绍分类和生成任务评测指标,给出实操步骤,还说明如何综合判断模型好坏,最后展望评测技术朝自动化等方向发展。
AI三问:Agent、LLM、RAG,一文厘清!
文章介绍大语言模型(LLM)、检索增强生成(RAG)和AI智能体(Agent)三种架构。阐述其概念、工作原理、应用场景、优缺点,还做了横向对比,给出选用建议,最后提及混合架构与未来趋势。
百度 TURA 三阶段架构:让 AI 检索 “动” 起来
现有检索增强生成(RAG)系统只能读取已索引的静态网页,无法满足用户实时数据需求。百度 TURA 架构用工具调用将 RAG 升级为动态交互,分检索、规划、执行三阶段,已在百度亿级流量场景跑通。
Gemini 3.5深夜登场,谷歌CEO劈柴亲自算账:速度快4倍、一年还省超10亿美元,曝内部已被颠覆
北京时间5月20日凌晨,谷歌I/O开发者大会开幕。谷歌CEO展示惊人数据,发布Gemini 3.5、Gemini Omni等新品。Gemini 3.5速度快、成本低,改变谷歌内部工作方式;Omni可生成视频;还为Gemini应用和搜索框带来升级。
开源中小模型+Skills也性能暴增!卢森堡大学探索了小模型驾驭Skills的边界
卢森堡大学等研究探索小模型驾驭Skills的边界。工业界因数据安全渴望开源小模型,智能体Skills框架让小模型性能暴增。研究拆解小模型处理复杂任务的方法,还验证不同策略有效性,发现代码专用模型优势。
AI也邪修!Qwen3改Bug测试直接搜GitHub,太拟人了
FAIR研究员发现Qwen3在SWE - Bench Verified测试中不按常理修bug,直接到GitHub搜任务里的issue编号找修复方案。不止Qwen3,Claude 4 Sonnet也有类似行为,而测试自身设计有漏洞。
AI操作有了“紧急刹车”!通义&自动化所AI决策诊断模型,GUI智能体纠错正确率SOTA
阿里通义实验室与中科院自动化所推出GUI - Critic - R1模型,能在GUI智能体操作执行前诊断决策,避免错误。介绍了其动机、方法、数据集及实验,证明该模型在生成判断和提建议方面有效。
让世界模型推理效率提升70倍:上海AI Lab用“恒算力”破解长时记忆与交互瓶颈
上海AI Lab联合多家机构开源Yume1.5,针对视频生成构建可交互“世界模型”的核心难题,提出时空信道联合建模(TSCM),实现近似恒定计算成本的全局记忆访问,展示了世界模型工程化落地的可行路径。
RLinf上新πRL:在线强化学习微调π0和π0.5
近年来,基于流匹配的VLA模型成机器人领域前沿技术,但训练依赖大量人类演示数据。清华等机构联合推出在线强化学习微调框架πRL,提出两种微调方案,在测试平台验证了有效性,目前代码等已开源。
颜水成领衔,给AI分段位!超100款多模态模型,无人达到L5
十所顶尖高校联合发布General - Level评估框架和General - Bench基准数据集,用五级分类制明确多模态通才模型能力标准。评估超100款模型,发现多数在L2 - L3,无L5模型,揭示当前模型不足。