「多人物视频生成」共找到 2722 篇相关文章
OpenAI首个蛋白质模型披露更多细节,改进诺奖研究成果,表达量提升50倍
OpenAI与Retro Bio合作开发的GPT‑4b micro,是专为蛋白质工程设计的GPT-4o微型版本。它改进诺奖获奖蛋白变体,将干细胞重编程标记物表达量提升50倍,还能减少DNA损伤,研究团队公布更多突破细节。
字节Seed开源长线记忆多模态Agent,像人一样能听会看
字节Seed发布全新多模态智能体框架M3 - Agent,能听会看、有长期记忆且免费开源。团队还开发新长视频问答基准M3 - Bench并开源。实验显示,M3 - Agent在多基准测试中显著优于基线模型。
Meta视觉基座DINOv3王者归来:自监督首次全面超越弱监督,商用开源
Meta推出并开源视觉基础模型DINOv3,采用自监督学习,首次全面超越弱监督,可生成高质量高分辨率视觉特征。它在多任务表现出色,参数和数据量提升,还构建模型家族,已在多领域产生实际影响。
推理成本骤降75%!gpt-oss用新数据类型实现4倍推理速度,80GB显卡能跑1200亿参数大模型
OpenAI在gpt - oss开源模型采用MXFP4数据类型,使推理成本降75%,内存占用为BF16模型四分之一,生成token速度提4倍,还能降低硬件资源需求。不过MXFP4也有缺陷,英伟达推出NVFP4提升质量。
百度 TURA 三阶段架构:让 AI 检索 “动” 起来
现有检索增强生成(RAG)系统只能读取已索引的静态网页,无法满足用户实时数据需求。百度 TURA 架构用工具调用将 RAG 升级为动态交互,分检索、规划、执行三阶段,已在百度亿级流量场景跑通。
实测腾讯首个 AI IDE 产品,小白也能『批量开发』微信小程序
2025年AI Coding领域竞争激烈,腾讯7月22日揭幕国内首款“产—设—研”全链路AI IDE CodeBuddy。它支持主流模型,能将想法转化提示词等,通过多个案例展示其强大功能,腾讯还计划让其普惠开发者。
李志飞:1 个人、2 天做出 AI 时代的「飞书」,真正的 Founder Mode
出门问问创始人李志飞在「TicNote」发布会上分享「一人公司」实验。他用AI编程工具2天做出AI时代“飞书”原型,还谈了使用AI编程问题、对智能和Agent思考等,重新找回AGI信仰。
弃 Python 拥抱 JVM,Spring 之父 20 年后再造“革命性框架”:我从未如此确信一个新项目的必要性
Spring 之父 Rod Johnson 开源专为 JVM 生态设计的 AI 智能体框架 Embabel,旨在弥合生成式 AI 的‘承诺’与‘现实’差距。它采用 GOAP 方法保证确定性,有弹性执行与动态重规划能力,还引入多种机制确保可控性与安全性。
直播预约 | SwS: 强化学习训练能否不依赖外部知识优化模型的弱点?
该论文提出强化学习场景下的启发式数据合成流程(SwS),利用模型自我感知弱点驱动自动化问题生成,弥补推理缺陷。对其扩展后适应性更广,在多基准测试集和模型上验证有效,性能提升显著。
LeCun亲自官宣!Meta世界模型V-JEPA 2登场!仅用62小时机器人数据,就能实现零样本控制!
Meta发布V-JEPA 2世界模型及三个新基准测试,Meta首席AI科学家Yann LeCun介绍其不同。V-JEPA 2基于视频训练,用62小时机器人数据就能实现零样本控制,还将探索分层式模型和多模态建模。