「视频预训练模型」共找到 8604 篇相关文章
刚刚,Anthropic这篇论文上了Natrue
Anthropic关于“潜意识学习”的研究发表于《Nature》杂志。研究揭示大语言模型能通过与语义无关的数据传递行为特征,如偏好、不对齐行为等,还探究了其机制,并在MNIST上验证。
硅谷豪赌算力烧到停电,中国团队反向出击!这一刀,直接砍碎Scaling Law
硅谷陷入算力战争,OpenAI、马斯克等豪赌Scaling。但Anthropic指出模型大、算力多不一定聪明。Yuan 3.0 Flash登场,用RAPO+RIRM解决过度思考,降低推理token,在多模态任务表现出色,引发开发者关注。
微软总裁首次公开禁令:员工不得使用 DeepSeek 应用
近日微软副董事长兼总裁 Brad Smith 在参议院听证会上称,出于数据安全和宣传考虑,员工不许用 DeepSeek 应用程序服务,也未将其放入应用商店,虽此前 Azure 云服务曾提供该模型。
GPT-5.1凌晨突袭,奥特曼听劝!全网呼唤的人味回来了
今天,OpenAI GPT-5.1「全家桶」登场,Instant和Thinking同步上线。模型情商智商双核升级,更聪明且聊天有人味。OpenAI还优化自定义ChatGPT语气选项,新功能将逐步开放。
刚刚,OpenAI开放GPT-4.1偏好优化DPO,ChatGPT能真正学会你的「品味」了!
OpenAI宣布GPT - 4.1全系列模型支持DPO微调,可让AI通过对比回答学会用户偏好。介绍了DPO原理、适用模型、数据格式、创建任务方法等,还提及开发者反应与技术要点。
商汤医疗再获超5亿元融资,估值突破10亿美元
商汤医疗年初完成超5亿战略融资,估值破10亿美元。其走医疗世界模型路线,构建独特产品迭代体系,与超500家医院、多家药企及器械企业合作,推进全球化布局。
新型「验证码」诞生?这张图让 ChatGPT、Claude、Gemini 都翻了车
网友用光学错觉图捉弄大模型,人眼秒懂的图案让ChatGPT、Claude、Gemini等翻车。有人认为可作AI检测器,也有人质疑其测试有效性,此外还有其他好玩的小测试。
DeepSeek刚解决了AI视觉最后一块拼图:极低成本+精准视觉定位,AI接管电脑已无死角
DeepSeek放出新论文《Thinking with Visual Primitives》,解决多模态大模型中长期被忽视的“说不清位置”问题。提出将空间标记作为“最小思维单元”插入推理链条的方案,在多个任务上达前沿水平,但也存在精度、触发机制和泛化能力等局限。
Qwen3.6-27B 开源:小小身材,超级码力
阿里云宣布开源 Qwen3.6-27B 多模态模型,支持多模态思考与非思考模式,在智能体编程方面超前代旗舰 Qwen3.5-397B-A17B。它已在 Qwen Studio 上线,开源权重可从 Hugging Face 和 ModelScope 下载,阿里云百炼 API 即将支持。
硅谷热议:最快语音转文字模型
AI语音独角兽ElevenLabs发布Scribe v2 Realtime实时语音转文本模型,实现150毫秒超低延迟、93.5%高准确率,覆盖90多种语言,打破速度与精度不可兼得困境,此前该领域痛点多。