「结构化多模态生成引擎」共找到 2650 篇相关文章
Agent 开发范式演进:从环境工程出发,“简化”多源实时上下文
本文整理自阿里云沈林在2026中国生成式AI大会分享。探讨企业级Agent落地瓶颈,指出关键在上下文供给能力,围绕信息完备性等五维度,介绍EventHouse如何让Agent接入业务环境,强调构建上下文体系重要性。
LLM 仅靠自身就能增强推理?SePT 给出简洁在线自训练范式
多数推理后训练方法依赖外部信号,SePT仅用模型自身生成的答案自训练,能提升推理能力,数学推理任务准确率升10个点。它核心简洁,设计关键是温度解耦等,不损模型通用能力,代码易迁移复现。
告别「想完再做」卡顿!清华StreamingVLA让VLA边想边行动,提速2.4倍
视觉 - 语言 - 动作(VLA)模型“观测 - 生成 - 执行”串行模式致交互卡顿,清华与联想合作提出StreamingVLA框架,引入两项技术实现并行处理,在测试中显著提升效率和流畅度,为VLA模型部署提供新方案。
1.9万行 Claude Code“AI垃圾”杀入 Node.js:全球顶流开源项目,快守不住了
2026 年 1 月,Node.js 技术指导委员会成员 Matteo Collina 用 Claude Code 生成近 1.9 万行代码提交 PR,引发争议。长期贡献者 Fedor Indutny 质疑其不符合 DCO 1.1 条款,而 Collina 认为自己担责,且开源生态已认可 AI 辅助贡献。
ICLR 2026 Oral | 让大模型学会“像法医般思考”,实现可解释、可泛化的深度伪造检测
生成式AI发展使深度伪造技术安全隐患受关注,现有检测器表现不佳。中科院自动化所联合蚂蚁集团提出Veritas框架,构建HydraFake数据集,赋予大模型“模式感知推理”能力,实验效果超现有检测器,还给出未来研究方向。
智能体安全如何保障?首个企业级AI Agent应用评估标准欢迎共同起草
近期OpenClaw走红,AI智能体从“能理解、能生成”走向“能执行、能协作”,但企业面临智能体上线条件判断难题。智合标准中心组织起草《企业级AI智能体应用效能评估规范》,现公开征集起草单位与起草人。
首次!AI智能体破解「纳什均衡」,大模型学会博弈论|Cell子刊
多所高校研究团队开发出PrimeNash大语言模型智能体框架,能自动推导纳什均衡闭式解析解并生成证明。它模拟人类科研路径,分三模块求解,经经典博弈验证,还在碳市场博弈展现应用潜力。
逆天!Mata用13个参数26字节让模型正确率从76%飙升至91%
Meta等机构研究人员发布TinyLoRA极致微调技术,配合强化学习,能在几乎不改变大模型原有结构下,用极少数参数激发其推理能力。该技术在数学推理上表现出色,还探索了参数共享策略和存储精度问题。
DeepSeek又拿第一!首创「因果流」视觉推理,超越Gemini
DeepSeek开源DeepSeek - OCR2,引入DeepEncoder V2视觉编码器,打破传统模型扫描限制,模仿人类视觉「因果流」逻辑。它解决了传统VLM忽略图像语义结构问题,在多项测试中表现出色,还验证了「LLM作为视觉编码器」可行性。
TPAMI | DC-SAM:打破SAM交互限制,基于循环一致性的图像与视频上下文分割方法
北京邮电大学联合南洋理工大学等机构发表论文,提出 DC - SAM 框架及 IC - VOS 基准。DC - SAM 含特征融合、正负双分支循环一致性提示生成等部分,实验在多基准测试获 SOTA 性能,为视觉大模型落地提供方案。