「原生融合」共找到 990 篇相关文章
邱锡鹏团队新作:让机器人学会「察言观色」
复旦大学邱锡鹏团队等发布全新操作框架 RoboOmni,突破传统 VLA 依赖显式指令局限。它融合多模态信号,构建数据集,在成功率等方面超基线,以跨模态指令让机器人主动推断意图,开启具身智能‘共情时代’。
独家丨盛大挖角代季峰,筹建新 AGI 公司对标 DeepSeek
AI 科技评论独家消息,盛大网络挖角清华副教授代季峰筹备新 AGI 公司,对标 DeepSeek,正招募核心团队。代季峰学术成果颇丰,项目或融合脑科学与 AI 架构,“旧互联网 + 学术”组合有挑战也值得期待。
一步步实战 CopilotKit(AG-UI协议):生成式 UI 与集成 Human-in-the-Loop【下】
文章延续上篇Demo,探索CopilotKit在重要场景的应用,如基于Agent的生成式UI、HITL人类参与流程等。展示了相关实例操作步骤与前端效果,指出其为构建智能应用奠定基础,降低AI融合门槛。
35B参数科学性能比肩万亿参数模型,『书生』科学大模型Intern-S2-Preview开源
5月15日上海AI实验室开源新一代大模型预览版Intern - S2 - Preview,尺寸小、科学能力强,在多方面有突破。其深化与昇腾算力生态协同,探索‘通专融合’,科学及智能体能力升级,还优化训推效率。
去掉 VAE 之后,商汤用 8B 参数重新定义了开源生图的上限
商汤SenseNova U1开源后引发开发者社区关注,它基于NEO - unify架构,摒弃VAE,实现多模态理解与生成原生统一。在多项基准测试中表现出色,还针对企业办公场景优化,成为生产级任务新选择。
阿里悟空全网首测
2026年OpenClaw引领AI Agent热潮,但对普通人不好用。阿里钉钉发布企业级AI原生工作平台悟空,预置多行业OPT套件,实测能完成设计等工作,解决OpenClaw部署和安全问题,且有阿里集团战略支持。
完爆ChatGPT!谷歌这招太狠:连你的「阴阳怪气」都能神还原
谷歌发布Gemini 2.5 Flash原生音频模型,可保留语调进行实时语音翻译,实现拟人化交互。还具持续监听、风格迁移等功能,提升开发者所需的函数调用、指令遵循等能力,另有实验产品Disco。
港科大&北京人形提出LOVON:足式机器人开放世界全域目标追踪新范式!
港科大广州联合北京人形创新中心推出LOVON框架,融合大语言模型、开放词汇视觉检测和语言 - 运动映射模型,解决足式机器人开放世界全域目标追踪难题,有抗干扰视觉处理等优势,性能超传统方法。
构建 Agent Native 软件的完整技术指南
Dan Shipper 和 Claude 联合撰写构建 Agent 原生软件技术指南,总结如何重新思考软件架构,让 Agent 成软件一等公民。指南源于实战,介绍构建原则、方法、执行模式等,还提及产品影响、移动端挑战及应对。
Sora 2瑟瑟发抖!通义万相2.5放大招:一句话出1080P电影,音画精准同步
云栖大会上通义万相2.5系列模型亮相,包含四大模型,视频生成模型实现音画同步突破,降低电影级视频创作门槛。它创作能力全方位升级,支持多种模态输入,采用原生多模态架构。