视觉预训练」共找到 2667 篇相关文章

新闻资讯8

Claude Opus 4.7突然发布:逐字级精准执行指令,软件工程和视觉能力大幅领先opus 4.6

Anthropic突然发布Claude Opus 4.7,重点提升软件工程能力,视觉能力也大幅跃升。指令遵循能力实质性提升,记忆能力改善。还同步上线新功能,升级前需关注分词器和token输出变化。

AI寒武纪
新闻资讯7

AI“读书”合法了:美法院最新裁定,无需作者同意,已购书籍可用于训练AI

美国法院裁决允许Claude背后公司Anthropic,在未经作者许可下用合法购买的已出版书籍训练AI,参考“合理使用”原则,认为属“转化性使用”。此前也有类似AI版权诉讼案例。

量子位
新闻资讯7

AI训练初创公司Mercor,年运收入4.5亿美元,冲击100亿美元估值

AI训练初创公司Mercor正洽谈C轮融资,目标估值100亿美元或更高。它为OpenAI等对接专家,还提供数据标注服务,年化运营收入近4.5亿美元,但也面临Surge AI等对手竞争,OpenAI新平台或带来新威胁。

AIGC开放社区
开源动态8

MiniMax开源首个视觉RL统一框架,闫俊杰领衔!推理感知两手抓,性能横扫MEGA-Bench

MiniMax开源首个视觉RL统一框架V-Triune,由闫俊杰领衔。该框架通过三层组件设计和动态IoU奖励机制,让VLM能联合学习推理和感知任务。还开发Orsta模型系列,在MEGA - Bench表现出色,且MiniMax多模态布局动作多。

量子位
算法论文8

CVPR 2026 | 让AI视频不再「串戏」:免训练精准控制多段动作,SwitchCraft一招破解逻辑崩坏

随着文本到视频扩散模型发展,AI视频生成有进展,但开源模型处理多事件提示词时存在技术瓶颈。西湖大学团队提出免训练框架SwitchCraft,引入注意力控制机制,入选CVPR 2026,代码已开源。

机器之心
新闻资讯8

硬核「吵」了30分钟:这场大模型圆桌,把AI行业的分歧说透了

在WAIC 2025大模型论坛的“模型之问”圆桌中,多位行业大佬围绕大模型展开辩论,话题涉及训练范式、模型架构、数据、开闭源等核心问题,不同观点碰撞,深入探讨大模型技术演进与发展之路。

机器之心
7

GPT-5两周内发布,内测猛料流出?GPT-6或已开始训练,奥特曼剧透百万GPU

有爆料称GPT-5将在两周内发布,是多模型组成的系统,含「路由器」,GPT-6已在训练。奥特曼称年底将增超百万GPU,有人看好GPT-5,也有人认为它可能只是路由器。此外,OpenAI有十名员工拒小扎3亿天价offer。

新智元
开源动态8

狂涨10.3K star!最近爆火的微信记录训练专属数字分身,支持语音克隆,绝了!

在AI大模型时代,大家想让模型更个性化。最近GitHub爆火的开源项目`WeClone`,用微信聊天记录训练专属AI打造数字分身,还能语音克隆。它全链路覆盖、支持多模型,有隐私保护等特色,操作也有介绍。

开源先锋
开源动态8

带图推理碾压同类开源模型!港中文微软等开源OpenThinkIMG框架,教AI学会使用视觉工具

港中文、微软等联合推出OpenThinkIMG开源框架,解决AI使用视觉工具面临的集成难、缺数据、适应差等问题,还公开核心技术V - ToolRL。该框架在图表推理任务上表现超GPT - 4.1,为下一代AI智能体提供基础。

量子位
开源动态8

视觉语言模型“扫地僧”:360低调开源FG-CLIP2登顶29项全球基准测试 | 甲子光年

两周前,360人工智能研究院低调开源FG - CLIP2,它在29个公开基准测试中超越Google和Meta的模型。该模型实现局部细粒度识别和原生双语对齐,为AI视觉理解设新基准,已服务开发者并在多领域落地。

甲子光年