「生成式过程监督」共找到 2599 篇相关文章
谷歌、Anthropic双重围剿下的OpenAI,正面临「生死抉择」
进入2026年,OpenAI将部分重心转向企业级市场,CEO奥特曼召集企业高管聚会,传达服务企业用户意向,还将推新方案助企业AI转型。其发力企业市场,是因流量被谷歌等竞品追赶,似走到转型十字路口。
VerseCrafter:给视频世界模型装上4D方向盘,精准运镜控物
复旦大学与腾讯等机构提出VerseCrafter,这是通过显式4D几何控制实现的动态逼真视频世界模型,能精准控镜和指挥物体3D运动。它用独特方法构建4D可控世界模型,实验超现有SOTA方法,代码与模型已开源。
15.1k,谷歌Notebook LM本地开源替代!
Open Notebook是开源、本地化且重隐私的Google Notebook LM替代方案。它支持超16家供应商,能整理多模态内容、生成专业播客,在多方面比Google Notebook LM更具优势。
让扩散模型「可解释」不再降质,开启图片编辑新思路
过去三年扩散模型席卷图像生成领域,但可解释性研究是‘黑箱’,且现有尝试常致性能下降。香港中文大学与上海人工智能实验室团队提出TIDE框架,可解释且不降质,还带来新图像编辑方式。
Anthropic重磅新研究:当AI采访了1250人,它看见了人类的「职业软肋」
Anthropic推出Interviewer工具,与1250名职场人、创作者、科学家深度对话,记录细节并量化。该工具能自动完成访谈、分析等流程,受访者满意度超97%。研究揭示不同职业对AI态度受职业结构等因素影响。
完爆ChatGPT!谷歌这招太狠:连你的「阴阳怪气」都能神还原
谷歌发布Gemini 2.5 Flash原生音频模型,可保留语调进行实时语音翻译,实现拟人化交互。还具持续监听、风格迁移等功能,提升开发者所需的函数调用、指令遵循等能力,另有实验产品Disco。
直播预约 | 迈向用于演绎推理的诚实语言模型
本次讲座聚焦迈向用于演绎推理的诚实语言模型。当前语言模型难诚实推理,输入不足会产生无根据答案。为此制定多步骤任务,提出强化学习方法ACNCHOR,稳定学习过程、提高推理性能。
Yann LeCun离开Meta后首篇论文?使用了宇树机器人做研究
伯克利、纽约大学等团队发表论文,提出GenMimic方法,让机器人能零样本复现AI生成视频动作。Yann LeCun是共同导师之一。团队构建GenMimicBench数据集,经仿真和真实实验验证方法可行。
千问 APP 再更新:为什么说「聊天」并不是 AI 产品的终点?
当前AI市场进入场景战役阶段,头部玩家都在去聊天化。千问APP此次升级,可在同一界面内完成办公场景从需求到成品的全流程,还覆盖多种模板,引入智能编辑器,是务实且有意义的探索。
一句话启动AI打工人?我用Claude Skills做了个“微博热搜挖掘机”,效率炸了!
作者黄叔分享用Claude Skills做“微博热搜挖掘机”,介绍其类似给AI员工发《员工手册》,还讲了准备工作,如获取微博热搜接口,输入指令后Claude自动干活,成果可观,Claude Skills适合普通人入门。