「视觉预训练」共找到 2671 篇相关文章
为什么自监督永远学不到语义?
《Visual Language Hypothesis》论文用纤维丛理论审视视觉表征学习,指出只做连续变换难触达语义。分析现有无监督学习不足,提出“Expand - and - Snap”机制,还通过实验验证,提供审视AI架构新视角。
计算所 x 上交大论文:只用双人数据,也能生成多人动画丨CVPR 2026
中国科学院计算技术研究所与上海交通大学团队提出多人物动画生成框架MultiAnimate,引入身份标识与空间关系建模方法,用双人数据训练,能扩展到多人动画生成,优于现有方法。
Vibe Coding 继续:这次,AI Studio 让你可以“画着改UI”
谷歌在AI Studio中引入注释模式,可乱涂乱画用注释命令修改,能更自然地更改应用,与Gemini进行直观视觉对话,还提到Cursor等IDE中类似功能实现方式。
告别单兵作战!这个Python语言驱动的AI智能体集群框架火了,30+工具一键调用!
团队开源了Python语言驱动的AI Agents开发框架Strands Agents Tools,提供30+预构建工具,支持多场景,降低开发门槛,为复杂任务调度和系统调用提供解决方案。
The Batch: 906 | AI 巨头分担维基百科的成本
维基百科成立25周年,维基媒体基金会与Amazon、Meta等多家AI公司达成合作,推出Wikimedia Enterprise计划,允许合作方高速大规模访问数据。维基百科需资金支持,AI公司也需其数据训练模型。
自动化评测的九九归一——评测agent
本文提出统一评测Agent架构,实现评测全链路自动化。它能学习标注标准,完成自动标注等工作。还介绍架构、解耦方法、模型优化及训练方案,解决多模态幻觉等问题,提升机审率,节省标注成本。
首篇WebAgents综述:大模型赋能AI Agent,实现下一代Web自动化
互联网任务重复繁琐,香港理工大学研究人员从架构、训练和可信性等角度,总结WebAgents代表性方法,梳理研究进展。WebAgents能根据用户指令完成网页任务,其发展预示人机关系新纪元。
腾讯混元TurboS技术报告首次全公开:560B参数混合Mamba架构,自适应长短链融合
腾讯公开混元TurboS技术报告,该模型是超大型Hybrid Transformer - Mamba架构MoE模型,融合Mamba与Transformer架构优势,有自适应长短思维链机制,激活参数56B。在多评测中表现佳,推理成本低。
你天天用的Claude和Codex,Meta内部不让随便用了
今年5月Meta给工程师划红线,限制用Claude Code和Codex,因其太好用。Meta组建团队自研编程助手MetaCode,担心外部模型输出渗进训练数据,出现“蒸馏陷阱”,且能省钱。
超 10 万人都在看!Qwen3重塑文本嵌入与重排序技术版图
文本嵌入和重排序是NLP和信息检索关键组件。Qwen3 Embedding、Qwen3 Rerank模型基于Qwen3基础模型构建,有三种参数尺寸。文章介绍其架构、训练方案,还给出实战代码。