「生成式任务」共找到 4199 篇相关文章
亚马逊“盲眼”机器人30秒跑酷首秀惊艳!华人学者领衔
亚马逊机器人团队FAR发布人形机器人研究成果OmniRetarget,它能让强化学习策略在复杂环境学技能并零样本迁移。该成果通过交互网格建模关系,经实验验证优势明显,背后团队由华人学者领衔。
Anthropic 深夜祭出 Claude Sonnet 4.5,能自主工作 30 小时!CEO:它更像你的同事
昨夜凌晨,Anthropic 推出新一代模型 Claude Sonnet 4.5,官方称其是世界上最好的编码模型等。该模型性能跑分登顶,工程落地能力强,还带来产品生态升级,开放 Agent SDK,误报率降低,价格亲民。
RLHF与RLVR全都要,陈丹琦团队最新力作将推理能力拓展到通用智能
普林斯顿大学陈丹琦团队发布学术成果,提出基于模型奖励思维的强化学习(RLMT)方法,弥合专门推理与通用对话能力差距,将链式思维优势扩展到更广泛范围,提升整体对话表现。
AI在实时视频里秒“剪”出你想要的部分!输入文字/图/视频片段,它都能秒懂|ICCV2025
最新混合模态在线视频定位技术OVG - HQ开挂了!它能根据文字、图、视频片段等线索,在实时视频流中精准裁剪出关心的事件,已收录于ICCV2025,破局以往技术“离线”“词穷”缺陷。
腾讯开源混元Image 2.1:2K高清+完美文字嵌入,图文天花板来了
今天凌晨,腾讯开源最新图像模型混元Image 2.1,支持原生2K分辨率与长提示词,文字嵌入能力强,适用于专业场景。还开源加速版模型权重和提示词改写模型,评估显示其性能达开源最优,接近闭源商业模型。
语音分离最全综述来了!清华等团队深度分析200+文章,系统解析「鸡尾酒会问题」研究
清华等多校及字节跳动研究者全面调研语音分离领域,撰写综述论文,分析200余篇代表性论文。从问题定义、学习范式、模型架构等多维度展开,还探讨评估指标、数据集等,指出未来挑战与探索方向。
刚刚!谷歌推出Nano Banana官方终极指南:六条保姆级权威提示教程,拿走不谢
谷歌推出Nano Banana(即Gemini 2.5 Flash Image图像模型)官方使用指南,含六条提示词模板及示例,介绍文生图等核心功能,还教你编写有效提示词发挥其潜力。
科研智能体「漫游指南」—助你构建领域专属科研智能体
该综述提供科研智能体构建指南,提出三级分级系统,阐述构建流程与能力增强方法,涵盖知识组织、注入、工具集成,还提及基准评估和未来研究方向,促进AI与自然科学融合。
腾讯张正友:具身智能必须回答的三个「真问题」
7月27日,腾讯发布具身智能开放平台Tairos。发布会后,腾讯张正友剖析战略选择背后的三个核心问题:架构上主张分层架构;认为具身智能第一性原理是身脑融合;强调要为长远目标放弃短期商业利益。
用Claude Code搭建工作流
作者原本考虑用n8n搭建工作流,现认为Claude Code的Sub - agents和自定义命令功能搭配MCP工具可满足需求。通过示例演示其工作流搭建,还测试换Kimi K2模型,显示其质量更好。