「后Transformer时代」共找到 3187 篇相关文章
用Claude Code剪视频,自动去口癖、加字幕、调色,完全免费开源
browser - use团队开源Claude Code技能video - use,可自动去口癖、加字幕、调色等。它通过转录文本和按需视觉合成图让LLM理解视频,有完整流水线和设计原则,还给出使用方法。
训练提速4.6倍!FP4+BF16双轨并行,NVIDIA×港大×MIT联手重新定义扩散模型训练速度上限
NVIDIA、港大、MIT团队提出Sol - RL,采用「FP4先探索、BF16再训练」框架,将扩散模型训练收敛速度最高提至4.64x,在速度与对齐效果间给出工程可行解法。
盘点过去一个月,大厂悄咪咪上线的 CLI 和 Skill
过去一个月,淘宝、微信支付、支付宝等大厂纷纷将核心能力以 MCP、Skill、CLI 形式交给 AI Agent 调用。如淘宝支持 AI 完成购物操作,支付巨头开放 AI 接入方案,滴滴和千问有打车 Skill 等。
AI搜索优化(GEO):从“被看见”到“被选中”的7个真相!【必看】
白杨SEO分享AI搜索优化(GEO)从“被看见”到“被选中”的7个真相,含为何做GEO、竞争内容、让AI理解和信任品牌的方法、成默认推荐答案的条件、效果评估及长期坚持的原因等。
多模态幻觉的病因「高熵节点」找到了!全基准幻觉率下降
多模态大推理模型的幻觉常出现在生成转折词时,此时模型处于高熵关键节点,易脱离图像证据。研究者提出LEAD,高熵时保留候选推理方向,注入视觉锚点拉回证据,实验显示它能跨领域提升模型性能。
养虾省91%词元!这家AI记忆公司用1亿个多模态文件验证了!
文章指出AI瓶颈已从模型智能转为记忆架构,长期记忆是AI有状态智能的基础。质变科技推出多模态AI记忆平台MemoryLake,具多种记忆能力和核心技术,降本增效显著,获资本青睐,服务多领域客户。
Anthropic 的 Harness 设计:build to delete
Anthropic工程博客发布Harness设计文章,探讨Claude完成全栈应用开发任务。指出单Agent模式问题,采用GAN式对抗、三Agent编排,对比单Agent与多智能体产出,还介绍调教评估者及编排简化,提出Build to Delete原则。
ICLR 2026 | ESC — 解构一步生成,厘清细节,探寻本质
西湖大学研究人员针对一步扩散生成模型复杂性问题,提出统一设计框架,对代表性模型进行组件级分析,定位关键误差来源,提出ESC变体,在ImageNet 256×256上取得优异成果。
当大家都在“养龙虾”时,阿里把生态里最大的龙虾递到了千问手里
2026年1月千问App上线点外卖、订酒店机票等服务,起初有局限,后体验改善。千问又上线“一句话打车”,接入阿里丰富生活服务生态,有望成“任务操作系统”,推动软件交互变革。
刚刚,全球视频模型新王诞生了!
天工AI的SkyReels-V4直接登顶Artificial Analysis文转视频全球榜,超越Veo 3.1、Sora 2。其相比之前有两大核心升级,让视频生成从‘生成片段’走向完整视频生产,还应用于短剧平台DramaWave。