「开源翻译工具」共找到 4408 篇相关文章
MiniMax开源首个视觉RL统一框架,闫俊杰领衔!推理感知两手抓,性能横扫MEGA-Bench
MiniMax开源首个视觉RL统一框架V-Triune,由闫俊杰领衔。该框架通过三层组件设计和动态IoU奖励机制,让VLM能联合学习推理和感知任务。还开发Orsta模型系列,在MEGA - Bench表现出色,且MiniMax多模态布局动作多。
HeyGen 开源了一个"用 HTML 写视频"的框架,我研究了一下,发现事情没那么简单
HeyGen 开源了 Hyperframes 项目,可让 AI 用 HTML 写视频。文章从其定义、上手教程、竞品对比等方面展开,指出它虽有短板,但代表视频制作新范式,建议相关从业者关注尝试。
双重突破:全球首个零售VLA大模型来了!开源OpenWBT让机器人遥操门槛暴降!
2025北京智源大会上,银河通用机器人展示端到端具身大模型GroceryVLA,可在商超场景自主操作,具强适用性等五大能力。还发布OpenWBT开源系统,降人形机器人遥操门槛,促产业发展。
Claude Design开源版本来了!支持超过 71 套最顶级的品牌设计系统,可以直接复刻,构建属于你的顶级网页!
Anthropic的Claude Design闭源,Open Design是其开源替代品。它支持超71套顶级品牌设计系统,可直接复刻构建网页,还支持多种coding agent,有完整提问机制,确保产出符合需求。
我用GLM-5肝出一个Rust版Agent系统,Opus 4.6迎来了最强开源对手。
作者实测智谱发布的GLM - 5后,用其开发出Rust版Agent系统并开源。还对比GLM - 5与Kimi 2.5、Opus 4.6,认为GLM - 5写后端能力强,让普通开发者也能用高级架构能力。
历史首次!o3找到Linux内核零日漏洞,12000行代码看100遍揪出,无需调用任何工具
OpenAI总裁转发成果,o3模型找到Linux内核SMB实现远程零日漏洞,未用复杂工具。研究员实验对比o3、Claude 3.7和3.5,o3表现佳,还能找到新漏洞、给出完善修复方案。
微软重磅开源!22K星的 VibeVoice 再添新成员,60分钟音频 ASR 端到端统一输出!
现在的 ASR 模型处理长音频存在断章取义、说话人错乱等问题。微软开源 VibeVoice-ASR,可一次性处理 60 分钟音频,实现“三位一体”输出,补齐 VibeVoice 生态,还介绍了特点、架构、使用方法与应用场景。
黑森林FLUX.2 Klein开源,亚秒级高质量图像生成和编辑,普通电脑就能跑
黑森林实验室发布开源的FLUX.2 Klein模型家族,是紧凑架构,将高质量图像生成与编辑速度压缩至亚秒级,在消费级显卡实现旗舰性能。其统一架构打破生成与编辑壁垒,还与NVIDIA合作优化。
超长推理还能节省计算!Salesforce开源神器两连发:教大模型边想边省,显著提升数学编程准确率
Salesforce AI Research开源Elastic Reasoning和Fractured Sampling。前者将推理流程分两部分,分配token预算,使输出缩短、准确性提高;后者打碎推理链条,从三维度采样,以更少tokens换更高准确率,均提升数学和编程任务准确率。
腾讯祭出开源核弹!LeVo音乐生成模型,媲美Suno,支持零样本风格迁移,歌词完美匹配
音乐生成领域有重大突破,腾讯AI Lab开源高保真音乐生成模型LeVo。它由LeLM和音乐编解码器组成,能解决现有方法在音质、音乐性等方面的局限,实验显示其优于现有方法,功能强大且适用场景多。