「团队聚焦」共找到 3989 篇相关文章
摩尔线程新一代GPU架构10天后发布
2025年12月19 - 20日,摩尔线程首届MUSA开发者大会将在北京举行。大会聚焦国产算力,主论坛将发布新一代GPU架构,还有20+技术专场和1000㎡科技嘉年华,官网已开放报名。
图像编辑缺训练数据?直接从视频中取材,仅用1%训练数据实现近SOTA效果
百度研究人员提出将图像编辑视为退化的时间过程,Video4Edit利用视频预训练模型知识迁移,仅用主流编辑模型约1%监督数据,在图像编辑任务达近SOTA效果,解决数据稀缺与权衡难题。
大模型被确诊「视觉文盲」!多校联合提出MILO,为它植入空间想象力
空间推理是多模态大语言模型(MLLMs)应用关键挑战,当前‘语言描述式调优’让模型成‘视觉文盲’。多校联合提出MILO范式,结合视觉生成反馈与语言调优,还构建GeoGen数据集,经五大任务验证其有效。
震撼全网!3位00后夺200万大奖,卷走鹅厂顶级Offer
历经四个月,「腾讯广告算法大赛」战果揭晓,「Echoch」战队夺冠,另有两支战队杀入三甲,前十名全员获鹅厂Offer意向书。赛事揭示推荐系统正迈入「端到端生成」新纪元,各战队方案亮点多。
短视频刷多了AI也会变蠢!“年度最令人不安的论文”
最新研究显示,大模型灌多垃圾内容会‘脑损伤’,研究人员用不同维度定义垃圾数据并训练模型,测试其核心能力,发现垃圾数据致认知下降,且损伤不可逆,还给出行业启发。
LinearRAG:一种免关系提取的高效 GraphRAG 图构建方法
研究指出 GraphRAG 模型在实际应用中表现常不如朴素 RAG 方法,原因是自动构建的知识图谱质量不佳。为此提出 LinearRAG 框架,有三大核心创新,在四大基准数据集上全面超越现有方法,代码和数据已开源。
牛B, 我去,新手小白也能使用InfiniteTalk搭建属于自己的数字人啦 ,真的太简单啦!!!
文章聚焦InfiniteTalk,剖析数字人视频制作痛点,阐述其以“稀疏帧视频配音”破题,具备无限长度、全身与表情同步等优势,介绍核心功能、使用方法,对比同类项目,凸显其多方面优越性。
Meta开源多语言语音识别系统,支持1600种语言,可轻松扩展新语种!
Meta研究团队开源Omnilingual ASR,能理解1600种语言,用几条语音 - 文本配对样本就能零样本扩展新语种。提供三种架构,满足不同需求,性能超现有多语种模型,应用场景广泛。
替代n8n,用TypeScript写工作流
文章指出n8n、Zapier拖放式工作流调试难、自定义受限,介绍Bubble Lab工具,其用TypeScript实现,代码可自由修改,执行信息透明,还支持导入n8n工作流文件再开发,有一定优势。
DMS Airflow:企业级数据工作流编排平台的专业实践
DMS Airflow 基于 Apache Airflow,集成阿里云 DMS 系统能力,为数据团队提供工作流调度等功能。文章介绍其高级编排能力、DMS 集成特殊能力及使用示例,总结核心优势与适用场景。