「开源框架」共找到 4136 篇相关文章
谷歌推出 LLM-Evalkit,为提示词工程带来秩序与可衡量性
谷歌推出基于 Vertex AI SDK 的开源框架 LLM - Evalkit,让大语言模型提示词工程更有序可衡量。它整合实验、测试等环节,与谷歌云工作流集成,有无代码界面,已在 GitHub 发布。
AAAI 2026 | 北航、东京大学填补AI「语义鸿沟」,过程感知视频理解如何找到「状态」锚点?
北航陆峰教授团队联合东京大学,提出视频理解新框架 TSS,引入“状态”作视觉锚点,解决抽象文本指令与具象视频对齐难题,已被 AAAI 2026 接收,代码已开源。
大语言模型逻辑评估
现有归因问答评估方法有‘归因短视’问题,研究团队提出 LOGICSCORE 框架,从三维度量化推理质量。在多数据集测试多款 LLM,发现专有、开源模型等存在不同逻辑问题,还分析典型逻辑错误。
CVPR 2026 | BiMotion:用 B 样条曲线重新定义 3D 角色运动生成
爱丁堡大学等团队提出 BiMotion 框架,将在 CVPR 2026 发表。它用 B 样条曲线表达运动,解决现有方法问题,有独特架构和损失函数,实验表现优,代码和数据集已开源。
字节Lynx:从单张图像生成高保真个性化视频
字节推出高保真个性化视频生成框架Lynx,基于开源的Diffusion Transformer,引入ID - adapter和Ref - adapter,在基准数据集表现优异,能平衡身份保真度等,还可拓展至多模态和多主体。
ICML 2025 Oral | 从「浅对齐」到「深思熟虑」,清华牵头搭起大模型安全的下一级阶梯
在大语言模型加速进入高风险应用场景当下,“安全对齐”是挑战。如今广泛采用的“浅对齐”脆弱不堪。清华团队提出STAIR框架,能提升开源模型鲁棒性,还推出RealSafe - R1模型进行安全对齐。
ICML 2026|让AI自动发现前沿风险:创智×复旦×牛津发布AutoControl-Arena
当AI智能体走向真实应用,前沿风险藏于复杂长尾场景,难以靠人工覆盖。创智、复旦、牛津联合发布AutoControl Arena框架,自动合成可执行测试环境,还构建X - BENCH验证,已在GitHub开源。
AI Agents的DeepSeek顿悟时刻:AutoHarness
文章介绍开源项目「Aha」— AutoHarness,这是面向AI Agent的自动化Harness Engineering轻量级治理框架,能让智能体迎来顿悟时刻。对比了其与LangGraph、OpenAI SDK能力,还给出核心架构、安装及使用示例。
AAAI 2026 Oral|InfiGUI-G1模型来了,刷新GUI Grounding SOTA
多模态大语言模型发展下,GUI Grounding任务是难题,现有RLVR方法有瓶颈。浙江大学等团队提出AEPO框架,推出InfiGUI - G1系列模型,小参数量刷新GUI基准测试SOTA,代码已开源。
任务级奖励提升App Agent思考力,淘天提出Mobile-R1,3B模型可超32B
现有Mobile/APP Agent依赖动作级奖励,难应对变化环境。淘天集团团队提出Mobile-R1框架,采用三阶段训练,结合任务级奖励,实验显示其表现超基准,团队还计划开源资源。