「推理框架」共找到 3348 篇相关文章
比SOTA快9倍,谷歌DeepMind时空重建,把视频变成时空搜索引擎
谷歌DeepMind联合团队发布D4RT时空重建框架,颠覆传统视频转3D方法。它按需提问,像搜索引擎,处理动态视频高效。内部结构分编码、解码两步,速度快,还发明聪明收割机算法,在多项测试中表现优异。
为什么Agent总是Demo猛如龙实战一条虫?
一篇51页论文研究主要智能体,指出适应性是关键。它提出2×2分类框架将适应方法分四大范式,还明确不同范式优缺点,发现T2范式数据效率远超A2。最后点明Agent适应性研究的四个前沿方向。
阿里妈妈发布MUSE:用多模态搞定十万级超长行为序列,并开源Taobao-MM数据集
阿里妈妈与武汉大学团队发布 MUSE 框架,用于终身用户兴趣建模,能处理 10 万级超长行为序列。还开源 Taobao - MM 数据集。MUSE 可插拔,已在阿里妈妈展示广告精排模型全量上线,提升 CTR 等指标。
12ms!一个仅8M的语音停顿检测模型
语音助手准确判断用户是否说完是挑战,Smart Turn将决策过程缩至12毫秒。其v3.1版有改进,新增数据集提升英语识别准确率,推出未量化版本推理更快,8MB模型性能优,已在HuggingFace开源。
图像编辑太慢太粗糙?全新开源自回归模型实现精准秒级修改 | 智象未来
AI图像编辑中扩散模型有两大难题,智象未来团队提出全新自回归图像编辑框架VAREdit,引入视觉自回归架构,提升编辑精准度与速度。模型和代码已开源,还提出SAR模块优化,在基准测试表现出色。
刚刚,智谱开源了他们的最强多模态模型,GLM-4.5v。
智谱接连开源GLM - 4.5和GLM - 4.5V,后者为多模态模型,总参数106B,在42个评测基准中41个达到SOTA。经测试,它视觉推理强、速度快,还有视频理解等功能,API定价良心,体现持续开放精神。
全网开测GPT-oss!技术架构也扒明白了
全网开测GPT-oss,它登顶开源模型王座,性能比肩o3-mini、o4-mini,适合本地推理。网友探索出多种用法,还推出Pro版。其架构也被扒出,官方介绍了微调方法,吴恩达等大佬也参与测评。
GPT-5将揭示人类的"创造力"其实就是模式识别?
有传言GPT - 5将发布,X上一博主称其或揭示人类‘创造力’是模式识别,引发热议。有人认为创意是碎片重组,也有人坚持创造力不只是模式识别,还需推理等,AI完美识别模式反被困住。
GPT-5被意外泄露,奥特曼宣布即将发布!
一则GPT - 5被意外泄露的消息引发关注,SecureBio的github配置文件中出现相关内容,暗示要把‘推理’提升到新高度。OpenAI CEO等暗示GPT - 5即将发布,但不打算短期内推出有IMO金牌级别数学能力的正式产品。
The Btch:838 | 苹果加强生成式 AI 布局
苹果更新 Apple Foundation Models(AFM)系列,含设备端和服务器端版本,还发布 Foundation Models 框架。AFM 模型架构特别,训练有优化,测试表现有差异。此前苹果论文引争议,此次或是其重启 AI 战略之举。