「高分辨率图像」共找到 2266 篇相关文章
让扩散模型「可解释」不再降质,开启图片编辑新思路
过去三年扩散模型席卷图像生成领域,但可解释性研究是‘黑箱’,且现有尝试常致性能下降。香港中文大学与上海人工智能实验室团队提出TIDE框架,可解释且不降质,还带来新图像编辑方式。
Hugging Face 论文页面功能指南
为助开发者与研究者把握AI前沿动态,Hugging Face推出论文页面,Daily Papers已收录超1万篇高质量论文。本文介绍其认领、提交论文等“隐藏功能”,助你把页面用到极致。
DeepSeek在Agent上做了件大事!
昨天DeepSeek发布V3.2正式版,强化Agent能力并融入思考推理,其在Agent评测达开源模型最高水平。文中分析Agent成开源‘心病’的痛点,介绍DeepSeek相关解决策略及成果,还给出使用示例。
一句话启动AI打工人?我用Claude Skills做了个“微博热搜挖掘机”,效率炸了!
作者黄叔分享用Claude Skills做“微博热搜挖掘机”,介绍其类似给AI员工发《员工手册》,还讲了准备工作,如获取微博热搜接口,输入指令后Claude自动干活,成果可观,Claude Skills适合普通人入门。
存储市场为何“超”了又“超”?
近日,闪迪宣布调涨NAND闪存合约价,三星等巨头财报业绩超预期。摩根士丹利预计存储行业将迎‘超级周期’。存储芯片全品类产品齐涨,终端与资本共振。本轮涨价因AI需求爆发与产能重构,未来市场前景好但有不确定性。
抛弃“级联”架构!快手OneRec用大模型重构推荐系统,服务成本降至1/10
传统级联式推荐架构有瓶颈,快手用OneRec重构推荐链路,服务成本降至1/10。文中介绍OneRec架构、Tokenizer方案、强化学习奖励设计,还提及优化及多模态联合训练方向。
马斯克抢先谷歌一步放大招,Grok 4.1登顶LMArena,创意写作直逼GPT-5.1
谷歌Gemini 3将上线消息正热时,马斯克旗下xAI的Grok 4.1凌晨上线。它有两个“形态”,免费开放且有APP版。在LMArena测试中表现优异,事实稳定性、情商、创意写作等能力提升,实测也有不错表现。
教育行业首个AI Agent落地!斑马口语「超人类外教」诞生
教育行业首个AI Agent落地,斑马口语推出「超人类外教」。它有「人」味,能灵活交流、共情,背靠猿力大模型,有记忆能力,性价比高,推动优质口语教育,或重塑教育行业。
解决特斯拉「监督稀疏」难题,DriveVLA-W0用世界模型放大自动驾驶Data Scaling Law
自动驾驶领域VLA大模型面临‘监督稀疏’难题,特斯拉公布此挑战。DriveVLA - W0研究提出用世界模型解决,将‘预测未来图像’作自监督训练任务,还提出轻量级架构降低推理延迟。
RAE+VAE? 预训练表征助力扩散模型Tokenizer,加速像素压缩到语义提取
近期,RAE 提出以「 冻结的预训练视觉表征」作潜空间提升扩散模型性能。同期西安交大与微软亚研院提出 VFM - VAE,结合 RAE 与 VAE,能加速模型收敛、提升生成质量,展示扩散模型 Tokenizer 演化方向。