长视频理解」共找到 2149 篇相关文章

开源动态8

腾讯混元开源AI绘画新框架:24维度对齐人类意图,让AI读懂复杂指令

腾讯混元团队开源PromptEnhancer框架,通过“思维链提示重写”提升AI绘画文本 - 图像对齐精度,复杂场景准确率提升17%以上。还开源高质量基准测试数据集,为研究提供支撑。

量子位
推荐文章8

CUDA-MODE第77课课程笔记:用于GPU kernels的DSL

该课程笔记由Tri Dao介绍GPU kernel开发的DSL生态,涵盖PyTorch、Triton、Cute - DSL等。提出计算效率评估公式,对比不同DSL在Softmax、GEMM等操作的性能。还提及其他DSL工具与Triton扩展项目,并给出使用建议。

GiantPandaLLM
产品应用7

一致性对标Nano Banana,国产Vidu Q1同时支持7张参考 | 实测

AI生图赛道竞争激烈,专注视频大模型的Vidu推出Q1参考生图模型,能同时支持7张参考图,主体一致性对标谷歌Nano Banana。实测玩法多样,有高可操作性,现已全球同步上线。

量子位
产品应用8

谷歌Nano Banana全网刷屏,起底背后团队

谷歌开发者节目展示了Gemini 2.5 Flash Image模型,它能快速生成高质量图像、保持场景一致。文中起底背后团队成员,还介绍模型技术亮点、与Imagen对比及未来能力展望。

机器之心
新闻资讯7

Cursor只排第6!136国用户实测25款AI编码工具,第一名73%胜率,还是个新面孔

Design Arena评测平台用对抗式评测方法,让用户对AI模型生成的设计作品投票,评估其设计美学表现。文章总结了上榜的编码工具,如new.website胜率约73%排第一,还对比了不同类型模型的排名情况。

AI进修生
新闻资讯7

Skywork技术论坛一手分享:Agent与多模态的落地真相|甲子光年

8月19日,昆仑万维发起第一期Skywork全球技术论坛讨论会,众多高校和企业嘉宾围绕Agent与多模态展开交流。探讨了Agent商业化、多模态应用等核心问题,提出诸多判断,指出行业热度高但落地是关键。

甲子光年
开源动态8

小扎又开源了:7B实现自监督学习SOTA

Meta发布全新开源视觉模型DINOv3,首次证明自监督学习模型能在广泛任务中超越弱监督学习模型。它用无标注方法,扩展数据和模型规模,支持标注稀缺场景,在多任务实现SOTA。

量子位
开源动态8

国产LLM又迎来一波开源潮:Qwen、华为盘古、腾讯混元、小米~

本周国产开源LLM集中爆发,Qwen、华为盘古、腾讯混元、小米等接连发布模型。如Qwen3 - 4B性能提升,Qwen - Image文生图能力强;华为开源盘古模型并宣布CANN开源;腾讯混元小尺寸模型特点多且已落地业务。

PaperAgent
算法论文8

北航LiveRepoReflection: 扭转乾坤-仓库级代码反射

本文提出LiveRepoReflection基准,评估多文件仓库代码理解和生成能力,含1888个测试案例。创建RepoReflection - Instruct数据集训练RepoReflectionCoder,评估40多个LLMs,结果显示其能有效测模型反思修复能力。

PaperAgent
产品应用8

AI 集成的智能 Profiling 实践:从性能分析到优化闭环

本文由韩钦亭撰写,分享了在已有 Profiling 平台引入 AI 智能辅助模块的实践。介绍了设计思路、工程实现、应用成效,对比不同大语言模型,通过实际案例展示优化效果,还探讨了 AI 在性能优化场景的未来潜力。

InfoQ