「OpenS2S」共找到 2091 篇相关文章
破解AI对不同上下⽂位置的敏感度不⼀致,新框架使出“解铃还须系铃人”
语言模型存在位置偏见,影响复杂推理等任务。论文提出Pos2Distill框架,将模型优势位置能力迁移到劣势位置缓解偏差,设计了Pos2Distill - R1和Pos2Distill - R2,在检索和推理任务表现好且有跨任务泛化能力。
华为版《黑客帝国》首次亮相:训推复杂AI前先“彩排”,小时级预演万卡集群
华为首次亮相数字化风洞虚拟环境平台,可在训推复杂AI模型前“彩排”,小时级预演万卡集群。其包含Sim2Train、Sim2Infer、Sim2Availability,分别解决训练、推理、高可用问题。
Waver:面向统一图像与视频生成的高性能基础模型
字节提出的Waver是面向统一图像与视频生成的高性能基础模型,支持T2V、I2V、T2I。它引入新架构、结合筛选流程与质量模型。虽有局限,但表现出色,架构设计独特,功能多样。
DeepSeek开源,Agent能力大升级,剧透2026!
DeepSeek昨晚更新并开源V3.2正式版及长思考增强版V3.2-Speciale,亮点是Agent能力进化。一年来它未增模型规模,靠架构优化等提升性能、降低成本,坚持自我路线很稳,V3.2继续提升能力。
实测可灵AI的新视频模型,它生成的动作戏酷到封神。
作者实测可灵2.5新视频模型,它已灰度内测并登上釜山电影节。与可灵2.1对比,可灵2.5在运动和表演能力上大幅提升,还增强了文生视频与理解能力,让创作者有更多创作自由。
Kimi新出的Agent集群,到底有多恐怖?
Kimi发布K2.5模型及Agent集群功能,将国产AI推向“组织智能”新高度。K2.5全能且开源,多项评测优于GPT - 5.2 - xhigh且成本低。Agent集群可按需协调子Agent,实现“角色涌现”与“3D编排”。
到底是谁在推崇 Nature、Science?——一场跨学科评价体系的结构性误解
文章指出不同学科对 Nature、Science(N/S)态度差异大,基础学科不看重,应用学科推崇。原因在于学科生态差异,N/S 是传播器,下游学科需其传播成果,大奖评价与 N/S 体系不同,国内不应将其‘工具化’。
【博客翻译】使用PyTorch加速生成式AI第四部分:Seamless M4T,快速优化
这是使用纯原生PyTorch加速生成式AI模型系列博客的第四部分,专注加速FAIR的Seamless M4T - v2模型。通过torch.compile + CUDA Graph,在不损失精度下实现text decoder模块2倍、vocoder模块30倍加速,端到端推理2.7倍加速。
谁家更新日志那么长啊?Claude Code版本更新引围观,1096次提交一口气上线
Claude Code 从 2.0.76 版本更新到 2.1.0,合入 1096 个 commit,更新日志超长引网友调侃。重点更新包括 Shift+Enter 换行、钩子支持等。后续又有 2.1.1 和 2.1.2 版本修复问题,但有开发者不满更新多且 bug 多。
2.4K Star!小米最新开源!覆盖600+语种的语音克隆TTS,40倍实时合成速度!
小米k2 - fsa团队开源OmniVoice,这是支持600 + 语种的零样本语音克隆TTS模型,性能超ElevenLabs v2和MiniMax等标杆,RTF低至0.025,合成速度快40倍,还支持声音设计等功能。