「超并行实验」共找到 3431 篇相关文章
256块NPU训成8B视频模型、超越Sora等一众闭源!抖音内容技术团队开源ContentV
近日,抖音内容技术团队开源ContentV,这是面向视频生成任务的高效训练方案。用256块NPU约4周训成8B参数模型,在多评估维度效果与主流方案相近,还探索了有限算力下训练路径,现推理代码与权重已开放。
图灵巨擘RL教父齐聚,机器人秀拳脚嗨翻全场!「悟界」首发引爆物理AGI
智源大会开幕,四位图灵奖得主等出席。会上,Bengio提出‘科学家AI’应对安全风险;Sutton称AI迈入‘体验时代’;Hausman讲构建物理智能。智源还发布‘悟界’系列大模型,含Emu3、Brainμ等,迈向物理AGI。
抽象小视频秒变特效大片:原视频精髓不变角色环境任意换,Luma出品
Luma AI推出Modify Video玩法,能将抽象小视频爆改为特效大片,可对角色、场景等任意换,还保留原视频动作运镜。能进行视频动捕、风格迁移、单个元素编辑,性能超越同行Runway。
ACL'25 | CIGEval:一种基于多模态大模型的可控生图评测智能体
阿里国际AI团队提出CIGEval,这是基于多模态大模型驱动的图像生成评估智能体框架。它集成多功能工具箱,通过任务拆解与工具调度提升评估准确性与可解释性,已在ComfyUI - Copilot上线。
上海AI实验室造出首个「通才」机器人大脑:看懂世界+空间推理+精准操控全拿下
上海人工智能实验室联合多家单位提出通用具身智能大脑框架VeBrain,能集成视觉感知、空间推理和机器人控制能力。它统一三类任务语言建模范式,有“机器人适配器”,配套VeBrain - 600k数据集,性能测试表现出色。
开源播客生成MoonCast:让AI播客告别"机械味",中英双语对话更自然!
MoonCast是革新性对话式语音合成模型,已开源。它借助LLM让剧本有干货与人味,采用全面规模化策略使音频合成更自然,性能在双语长对话播客上提升显著,接近真人播音效果。
4个文件,1个超级目标,我用Trae搭建了一个不会"失忆"的AI分身,还免费
AI产品黄叔分享用字节AI IDE Trae搭建AI分身的经验。他指出原用的Monica有价格高、记忆受限等局限,新系统含个人档案等四模块,由智能体串起,能自动同步,体验更好,还适合PDCA循环助力自我提升。
OpenAI推出云端编程智能体Codex,进一步推动软件工程领域变革
OpenAI昨夜发布研究预览版Codex,一款集成在ChatGPT中的高级编码智能助理。它基于codex - 1模型,支持多种编程语言,有深度代码分析等核心功能,还有codex - mini - latest API版本,或重构软件开发行业。
文生图进入R1时代:港中文MMLab发布T2I-R1,让AI绘画“先推理再下笔”
港中文MMLab团队发布首个基于强化学习的推理增强文生图模型T2I - R1。它提出双层级CoT推理框架和BiCoT - GRPO强化学习方法,解决生成评估难题,为多模态生成提供新范式。
突破多模态奖励瓶颈!中科院清华快手联合提出R1-Reward,用强化学习赋予模型长期推理能力
多模态奖励模型(MRMs)对提升多模态大语言模型表现至关重要,强化学习理论上可引入长期推理能力,但现有RL算法用于训练MRM会不稳定。中科院、清华等团队推出R1 - Reward模型,在多模态奖励模型benchmark上有显著提升。