「推理数据生成」共找到 5765 篇相关文章
阿里刚刚开源了一款影视级配音项目,口型同步、音色转换都不是事!
阿里通义实验室语音团队联合中科大发布多模态电影配音模型Fun - CineForge,开源模型并构建中文电视剧配音数据集。它能处理多种场景,有视频理解等亮点,还给出制作数据集步骤。
ICML 2026 | 只用少量Thinking Tokens,大模型依然能深度思考
近年来,CoT 推理成为提升大模型复杂问题求解能力的重要路径,但带来效率问题。浙江大学等团队提出 Heima 框架,将冗长 CoT 压缩为少量 thinking tokens,在减少 token 数的同时保留推理能力,已被 ICML 2026 接收。
实测Gemini图片转视频新功能,终于蹲到经典梗图后续了(doge)
Gemini接入带声音的图片转视频功能,作者实测该功能。用开盒指令测试,生成速度较快;还尝试给梗图加后续,发现生成精确内容需详细提示词,且不能生成具体真人形象内容。
航空发动机用上大模型:解决复杂时序问题,性能超越ChatGPT-4o实现SOTA|上交创智复旦
上海交通大学李元祥教授等团队提出ITFormer架构,构建EngineMT-QA数据集。ITFormer能融合时序数据与大语言模型,适配多种编码器和模型,在EngineMT-QA预训练后达SOTA水平,实现高效数据分析。
重磅发现!大模型的「aha moment」不是装腔作势,内部信息量暴增数倍!
中国人民大学等联合团队研究发现,大模型推理有“信息脉冲”,特定步骤互信息值飙升形成“互信息峰值”,对应“思考词汇”。基于此提出无需额外训练提升推理性能的方法,代码已开源。
DeepSeek-R1全升级V2版:Token成本低至原来30%
DeepSeek - R1 V2版全维度升级,训练框架从‘单一RL’到‘多阶段协同优化’,推理能力从‘能推理’到‘会优化推理’,还提升了安全可控性,适配生态,推出轻量级模型。
三位哈佛辍学生,如何将专用芯片变成估值百亿美元的 AI 算力公司
文章聚焦 Etched 公司,分析推理成 AI 算力主战场背景,介绍三位哈佛辍学生创始人故事,阐述其从芯片到推理集群的产品打造,还提及团队、文化、资本情况,最后分析竞争格局与前景。
当机器人学会「看」和「说」之后,如何让它们真正拥有「手感」?
今年四月,戴盟机器人联合多家机构发布含触觉全模态具身数据集 Daimon-Infinity 并开源 10000 小时数据。IEEE 与戴盟联合创始人王煜教授深度对话,探讨触觉感知对机器人技术格局的影响、具身机器人落地场景等问题。
没想到 50 岁了我开始手搓小游戏:灵光闪现
作者池建强分享AI领域“生成涌现”现象,以Gemini 3.0演示为例,又介绍蚂蚁集团的灵光App,其闪游戏功能让普通用户用一句话生成小游戏,能修改迭代,体现AI构建系统能力,创作平权或到来。
终于不用羡慕老外了!美团竟然做出了类似V0&Bolt的AI编程神器
美团推出零代码应用生成工具NoCode,类似V0&Bolt。它功能强大,能生成复杂网页应用,支持提示词生成、自动优化、快速部署等,还自带数据库服务,免费且无需邀请,为国内Vibe Coding带来曙光。