「基础开发框架」共找到 3487 篇相关文章
AAAI 2026 Oral | 手机传感器正在泄露隐私?PATN实时守护隐私安全
移动应用获取手机传感器数据支撑重要功能,但带来隐私隐患。西安交通大学与东京科学大学在AAAI 2026提出PATN框架,基于对抗攻击思想,设计两大核心技术,能在多种场景下守护隐私安全。
SIGGRAPH Asia 2025|电影级运镜一键克隆!港中文&快手可灵团队发布CamCloneMaster
香港中文大学与快手可灵团队联合提出运镜可控视频生成框架CamCloneMaster,引入‘参考即用’范式,告别对相机参数依赖。其训练、测试代码和数据集均已开源,在各项指标上优于SOTA方法。
230个大模型在婴幼儿认知题上集体翻车!揭秘多模态大模型的核心知识缺陷
ICML 2025研究揭示多模态大模型在基础认知能力上表现不佳。研究者建测评题库CoreCognition测试230个主流模型,发现其存在核心知识缺陷,扩规模难补短板,还需补齐核心知识。
出自小米的模块化图像编辑改造:让 AI 学会「搭积木」
小米研究团队发布 Lego-Edit 图片编辑框架,将复杂编辑任务拆成工具集和调度系统,工具集模型各司其职,调度系统指挥操作。采用渐进式训练,性能优、扩展性好,体现协同智能优势。
突破Agent长程推理效率瓶颈!MIT&新加坡国立联合推出强化学习新训练方法
AI Agent处理复杂任务时显存、算力问题凸显,MIT和新加坡国立大学联合提出MEM1框架。它基于强化学习,让智能体学会管理记忆,实现近似常量级显存开销,在多方面表现超越大模型。
用子模优化法为DeepResearch生成多样性查询
开发DeepResearch时,生成多样化查询是关键。多数开源项目处理方法粗放,本文提出结合句向量与子模优化的方法,设计子模目标函数,给出代码实现,实验显示该方法生成的查询组合多样性更高。
8秒极速生成!复杂场景图像定制低成本轻松驾驭,已开源丨字节北大联合发布
字节跳动与北大联合推出支持多条件组合的统一图像定制化生成框架DreamO,能实现主体、身份等多样化定制。与商业大模型比,它开源、成本低、速度快,8 - 10秒可完成图片定制。
长程 Agent 越跑越乱?ContextPilot 用细粒度 RL 教会模型主动管理上下文
长程 Agent 推理时,传统方法使上下文臃肿、推理成本高。清华、腾讯等团队提出 ContextPilot 框架,扩展管理工具集、采用新采样和信用分配方法。实验显示其用短上下文获高分,降低推理开销。
强化学习没作用?人大DelTA精准识别关键token,推理正确率大幅上升
人大高瓴研究团队提出DelTA算法,不依赖经验为强化学习目标中每个token算最优权重。实验显示它适配主流强化框架,在多任务上提升base模型效果,还能让训练更稳定。
给 Agent Skills 装上眼睛:MMSkills 用多模态技能包教会智能体看状态、做决策
上海交通大学和小红书团队推出面向通用视觉 Agent 的多模态技能框架 MMSkills,将可复用技能扩展为多模态程序性知识,通过 branch loading 调用视觉证据,在 GUI 与游戏任务评测中表现出色。