图像到视频」共找到 3241 篇相关文章

算法论文8

LLM的快速、慢速与工具增强思维模式综述

大型语言模型在不同任务中对推理策略需求差异大,策略选择不当会影响效率与可靠性。本文提出双重知识边界框架,梳理LLMs推理模式,将策略选择形式化,还分析了决策因素及策略选择机制。

深度学习自然语言处理
产品应用7

破局之刃已然出鞘!国产处理器选哪家?

本文精选2025年参评“芯师爷-硬核芯年度评选活动”的国产处理器产品,介绍了海光、紫光同创等企业的处理器特点及应用场景,指出国产处理器在性能逼近国际主流,未来胜负手是生态协同与场景渗透。

芯师爷
8

仅2G内存可跑,刚刚,谷歌开源Gemma 3n,端侧原生多模态!

谷歌全面发布Gemma 3n,将多模态AI功能带入边缘设备并在Hugging Face开源。它原生支持多模态输入输出,针对设备端优化,内存占用低,采用开创性架构,Gemma系列质量也不断突破。

PaperAgent
算法论文8

ETT:打破原生多模态学习视觉瓶颈,重塑视觉tokenizer优化范式

本文由多机构联合完成,针对传统视觉 tokenization 方法优化与下游任务训练割裂问题,提出 ETT 调优方法。它实现联合优化,在多模态理解、生成、重构任务表现出色,虽有局限但带来新突破。

机器之心
新闻资讯9

“35岁以下科技创新35人”2026年全球入选者名单发布,他们正在抵达未知之境

自1999年起,《麻省理工科技评论》评选全球35岁以下年轻创新者,本文发布2026年度榜单,介绍了35位入选者在AI、生物、能源、气候等领域的核心创新成果。

DeepTech深科技
算法论文8

EMNLP 2026高分论文MathDebugger:当合成数据涌入训练集,如何为数学题做体检?

随着合成数据增多,模型需判断数学数据题目能否被信任。北大DCAI团队提出MathDebugger质检BenchMark,覆盖问答两端,评测主流LLM和PRM。还探究能否判断正误、分类错误、修复数据,证明错误标签可作监督信号。

InfoQ
推荐文章7

AI来了,职场逻辑也变了

AI来使职场规则和逻辑改变,作者给出三条判断:公司人才观变为宁缺毋滥、优先筛选;主观能动性价值放大;纯管理岗位风险上升,建议管理者回一线结合AI做业务。

newtype AI
开源动态8

统一VLA范式!港科大开源StarVLA乐高式架构,复现成本大幅降低

当前具身智能的VLA赛道陷入「碎片化」泥潭,方法难对比、复现成本高。港科大开源StarVLA,提出「乐高式」统一架构,构建模块化开源底座,实现双向模块化,还支持多种训练范式,打通Sim2Real。

新智元
算法论文8

10倍加速化学推理大模型!Haven团队在隐空间思考分子式,碾压显示CoT

Haven团队提出LatentChem,把化学推理从‘文本表面’挪‘模型内部’,先在隐空间思考,再在语言空间回答。它拆分‘推理’与‘表达’,性能优异,为AI Scientist奠定基础。

量子位
新闻资讯8

AI大牛刘威创立的Video Rebirth,刚刚又完成8000万美元融资

AI视频生成企业Video Rebirth完成8000万美元融资,由AMD Ventures、现代汽车等跨界投资。其由刘威创立,首创Dual Diffusion Transformer架构,新资金用于Bach模型商业化与全球扩张。

机器之心