「长任务跑分」共找到 2657 篇相关文章
ACL 2026|清华新作ControlAudio:声音何时响、说啥话?都能按剧本可控生成!
现有文生音频技术在精细化控制方面有挑战,清华团队提出ControlAudio方法。它通过数据构造、渐进式训练和引导采样,在统一框架下实现时间与语音内容联合建模,在多项任务上表现优于现有方法。
三维空间太难懂?RoboTracer让机器人理解复杂空间指令,推理3D空间轨迹,开放世界也能精确行动
家庭环境复杂,让机器人理解空间指令难,现有VLM多聚焦2D推理。北航、北大等联合推出多模态大模型RoboTracer,能精准生成3D轨迹,在多项评测中领先,还能直接集成到机器人,完成复杂任务。
DeepSeek开源的不仅仅是个新OCR模型。。。
DeepSeek开源3B参数的新OCR模型,重新思考AI处理长文本方式,用视觉token压缩文本信息。核心组件有DeepEncoder和DeepSeek3B - MoE解码器,实验效果好,成本降低,还解决了一些算法和工程问题。
刚刚,DeepSeek论文登上Nature,更多细节披露!
9月17日,梁文锋担任通讯作者的DeepSeek - R1推理模型研究论文登《Nature》封面,它是全球首个经同行评审的主流LLM。不靠人工标注,靠强化学习激发推理能力,学会‘自我反思’,在多任务上优于传统模型。
真可用!美团数字人模型开源,MV、电商等统统拿下
美团开源数字人视频生成框架 LongCat - Video - Avatar 1.5 版本,换音频编码器、加速推理,支持多任务与多场景。经770人评测,它在多维度领先对手,各方面表现均衡,效率与质量兼得。
OpenAI连夜爆出GPT-5.4! 紧急上新GPT-5.3反击谷歌, AI爹味治好了
谷歌DeepMind推出Gemini 3.1 Flash - Lite不到2小时,OpenAI上线GPT - 5.3 Instant,不卷跑分,专治「聊天翻车」,幻觉率降27%,写作能力提升,还剧透GPT - 5.4更快到来。
知识增强LLM与搜索引擎用户的感知信息价值差异比较研究
研究选取文心一言与百度搜索引擎,探究不同任务复杂性、信息获取场景下,用户使用两种工具后的感知信息价值差异。发现两者在部分指标有显著差异,还给出两类工具优化建议。
MiniMax Agent 再进化!正式走向商业级全栈开发
MiniMax Agent 升级成‘全栈开发师’,建立完整交付标准,构建技术生态。它能完成多任务,配置顺滑,可处理前端问题。还在 MCP 生态、支付集成等方面革新,从工具迈向数字化商业引擎。
4000 Star,Vibe Coding终级指南:胶水编程
Vibe Coding由karpathy提出,本文分享其终极指南。介绍了胶水编程、方法论精要、工具资源、编码模型性能分级参考等内容,还给出架构与工作流程,建议选第一梯队模型处理复杂任务。
小米MiMo-V2-Flash开源:3090亿参数大模型能否改写AI行业规则!
2025年12月16日小米开源旗舰大模型MiMo - V2 - Flash,参数3090亿。它有独创‘按需激活’机制,推理成本低。采用MIT协议,价格亲民,构建全栈开源矩阵,在编程、长文本处理等领域表现出色。