长文本优化」共找到 2117 篇相关文章

算法论文8

VDC+VBench双榜第一!强化学习打磨的国产视频大模型,超越Sora、Pika

复旦大学等机构将强化学习引入视频生成领域。提出的Cockatiel方法在VDC榜单夺冠,IPO方法在VBench登顶,超越Sora、Pika等模型,优化后视频生成效果在多方面显著提升。

机器之心
算法论文8

西湖大学提出RDPO强化学习框架,实现扩散模型并行推理加速

扩散模型“顺序去噪”特性成速度提升瓶颈。西湖大学AGI Lab提出RDPO框架,不必改动模型本身,优化其“采样导航系统”,在多基准测试中取得领先图像生成效果,解决加速问题并提供RLHF对齐新范式。

量子位
产品应用8

阿里又上好货了!Qwen3-TTS能力大幅提升

阿里刚发布Qwen3-TTS(2025-11-27版),解决语音合成核心问题。它音色大幅扩展,有49种高品质音色;语言和方言能力提升,支持10种主流语言与多种方言;韵律和语速优化,拟人化近真人;API调用简单。

AI工程化
开源动态8

白嫖微软开源Web Agent,独立开发者的第二双手:自动刷网页、跑脚本、盯进度,全交给 Magentic-UI

Magentic-UI是微软开源的Web Agent界面,能控制浏览器、执行代码等,解决流程、重复且让人不放心全交给AI的任务。它可视化操作,有可复用计划图库等亮点,使用体验好,适合特定开发者。

小华同学ai
Product Application7

mcp-feedback-enhanced:一个让 Cursor 500 次额度膨胀N 倍的骚气 MCP!一次请求变成 N 次!

Cursor每月500次请求额度常不够用,网友分享“咒语”利用其工具调用功能让一次请求变多次。mcp-feedback-enhanced这个MCP工具能将多次交互合并到一次请求,还介绍了使用、安装配置及持续调用优化方法。

AI进修生
开源动态8

告别「面瘫」配音,InfiniteTalk开启从口型同步到全身表达新范式

传统video dubbing技术有局限,新兴模型也有问题。美团视觉智能部研发的InfiniteTalk引入‘稀疏帧video dubbing’,实现口型、表情、肢体与音频自然对齐,解决视频生成难题,技术已开源。

机器之心
算法论文8

Transformer祖传设计遭暴击,COLM顶会三篇论文发难

COLM 2026上,三篇论文对Transformer关键技术发难。《Cracks in the Foundation》指出上下文架构选择影响大;《Lost in Backpropagation》揭示输出投影层信息损耗严重;《When Fewer Layers Break More Chains》表明层剪枝影响链推理。

量子位
产品应用8

YOLO26(极速目标检测) + SAM3(精准掩码生成) 搭建一套实用的流水线

文章介绍用 YOLO26 极速目标检测和 SAM3 精准掩码生成搭建流水线。阐述二者原理,给出环境配置、实战代码,分析结果,还介绍进阶优化技巧和常见问题解决方案,适合实时应用场景。

机器学习AI算法工程
开源动态7

硬核拆解 OpenClaw:如何构建真正稳健的生产级 Agent 系统?【下】

本文延续上篇,继续拆解 OpenClaw 中 Agent 模块工程方法,涵盖安全与风险防御、记忆与状态管理、成本与效能优化、子 Agent 协作机制,介绍其方法并解读,指出企业场景需做取舍。

AI大模型应用实践
开源动态8

多模态Qwen3-VL-Embedding开源&技术剖析

互联网内容多元,传统文本搜索引擎应对跨模态需求力不从心。阿里开源Qwen3-VL系列两大模型,Qwen3-VL-Embedding负责“海选”,Qwen3-VL-Reranker负责“决赛”,技术亮点多,实验表现优异。

PaperAgent