大模型预训练」共找到 9612 篇相关文章

算法论文7

The Batch: 931 | 统一视觉媒体的单一分词器

Apple团队开发多维分词器AToken,可将图像、视频、3D对象映射到共享token空间,统一处理视觉媒体。它由预训练编码器和解码器组成,经多阶段训练,在多任务上达或接近先进水平,为视觉模型带来通用性。

DeeplearningAI
新闻资讯7

突发!Gemini 3.8登顶,谷歌迈出RSI一

谷歌发布Gemini 3.8 Flash及专攻网络安全的3.8 Flash Cyber。前者性价比高,在多项测试逼近顶级模型;后者在网络安全测试屠榜。但谷歌也被指提前庆祝,且模型可能有‘刷榜’成分。

新智元
开源动态8

腾讯开源Stand-In!轻量级身份保留视频生成新突破

生成符合指定身份的高保真视频挑战,现有方法依赖参数且兼容性不足。腾讯开源轻量级、即插即用的Stand - In框架,在身份保留文本生成视频任务中性能先进,兼容性强,有广阔应用潜力。

带你学AI
算法论文8

自适应Agent基础模型:从“会推理/会用工具”到“懂得取舍的执行者”

当前型语言模型在智能体/工具调用场景有推理型和工具型两类,存在效率与功能、深度的矛盾。A²FM框架提出多模式自适应路由,实现模式自适应切换,在多基准测试中效果与效率双升。

深度学习自然语言处理
开源动态8

OpenAI重新开源!深夜连发两个推理模型,o4-mini水平,笔记本、手机可跑

OpenAI 自 GPT - 2 后重新开源,此次连发两个推理模型 gpt - oss - 120b 和 gpt - oss - 20b。它们性能达 o4 - mini 水平,可在笔记本、手机运行,有宽松许可等亮点,在多测试中表现出色。

机器之心
算法论文8

视频扩散模型新突破!清华腾讯联合实现高保真3D生成,告别多视图依赖

清华学联合腾讯提出Scene Splatter,基于视频扩散模型,从动量视角引导其生成满足三维一致性的视频片段,提升三维场景生成效果,解决了传统方法在单张图片重建三维场景的难题。

量子位
产品应用8

顶级邪修|万字教程|教你速通豆包・图像创作模型 Seedream 4.0

火山引擎上线豆包・图像创作模型Seedream 4.0,支持图片生成、连续编辑等。它美学表现佳、支持中文,企业可通过火山方舟接入,个人今晚20:00可在指定渠道体验。文中还给出多种玩法及对应提示词。

歸藏的AI工具箱
新闻资讯7

数学题干带猫AI就不会了!错误率翻300%,DeepSeek、o1都不能幸免

研究发现,在数学题后加如“猫一生绝多数时间都在睡觉”这类话术,会让模型答错概率翻3倍,DeepSeek - R1、OpenAI o1等推理模型中招。研究探索攻击方式,总结出三种攻击模式。

量子位
开源动态8

新型开源端到端 AI 语音模型!Voila:195ms 超低延迟引领全双工对话!

Maitrix团队发布开源AI端到端语音模型Voila,以195ms超低延迟及全双工对话受关注。它功能强,支持多语言,有多种使用方式,适用于多个场景,架构采用模块化设计。

开源星探
新闻资讯8

对话零跑汽车周洪涛、冯铭月:零跑世界模型的300天|甲子光年

本文是甲子光年对零跑汽车周洪涛、冯铭月的独家对话,披露零跑智驾从跟随策略转向押宝世界模型的研发过程、技术路线选择与普惠升级计划,还原零跑智驾超车历程。

甲子光年