视觉token」共找到 1235 篇相关文章

产品应用7

关于Claude Skills,我给你写了份82页的白皮书

作者关注Claude Skills功能已久,使用后感受是它让Claude学会按需加载。还解析了Skills、MCP、Sub - agents区别,指出有人认为Skills比MCP更重要,最后介绍82页白皮书内容及获取方式。

花叔
产品应用8

抛弃“级联”架构!快手OneRec用大模型重构推荐系统,服务成本降至1/10

传统级联式推荐架构有瓶颈,快手用OneRec重构推荐链路,服务成本降至1/10。文中介绍OneRec架构、Tokenizer方案、强化学习奖励设计,还提及优化及多模态联合训练方向。

InfoQ
新闻资讯7

Meta 系 95 后华人明星团队,创业一年就与高通达成合作,让手机拥有多模态记忆

由华人创业者沈俊潇创办的 Memories.ai 发布 LVMM 2.0 并宣布与高通合作,该模型 2026 年将在高通处理器上原生运行。它解决视频可搜索性问题,应用广泛,能降低延迟、确保数据安全等。

Founder Park
算法论文8

传统训练效率很低?我们靠 “给模型降噪” 重新审视长上下文建模难题

文章指出长上下文模型处理长文本时易受噪声干扰,提出新评估指标IG分数和“上下文去噪训练(CDT)”方法。实验表明CDT优于现有策略,经其训练的开源模型在长上下文任务中性能媲美GPT - 4o。

深度学习自然语言处理
算法论文8

轻量高效,即插即用:Video-RAG为长视频理解带来新范式

现有视觉语言模型处理长视频面临诸多难题,厦门大学等联合提出轻量高效、无需微调的 Video-RAG 框架,采用多模态辅助文本检索增强生成,解决长视频理解问题,适用于多场景。

机器之心
新闻资讯8

刚刚,Figure 03惊天登场!四年狂造10万台,人类保姆集体失业

通用机器人曙光来临,Figure 03正式亮相,专为Helix「大脑」打造,手掌心有摄像头,指尖能感知3克力。其进化亮点多,未来四年将量产十万台,适用于家庭和商用场景。

新智元
算法论文7

InfiniteTalk:音频驱动的从口型到全身动作同步方法

近年来视频AIGC推动音频驱动人体动画变革,但传统视频配音局限口部。中国科学院大学提出稀疏帧视频配音范式,推出InfiniteTalk生成器,结合多种技术实现全身动作与音频同步,实验表现突出。

带你学AI
算法论文7

The Batch: 863 |推理提高了碳排放

新研究量化推理模型时代提供更优答案的环境成本,研究人员估算14个开源权重的大模型碳排放,发现推理与排放存在权衡关系,还指出战略性部署可降低排放。

DeeplearningAI
新闻资讯8

2025 WAIC落幕,深谋科技异军突起,以技术与落地破局具身智能赛道

2025 WAIC落幕,深谋科技作为精英合作伙伴首次亮相,未随波逐流,而是切入脑控、动态视觉伺服和康养场景三大底层能力领域,开拓创新赛道。其产品已商用部署,吸引众多媒体关注。

AI科技评论
算法论文8

DeepSeek推理最高提速6倍!开源研究:加装「思维进度条」,计算量减少30%

特拉维夫大学团队开发新方法,给LLM推理任务装进度条,控制推理深度和速度。提出“思维进度向量”TPV预测推理位置,干预TPV可“超频”“降频”,模型已在GitHub开源。

量子位