「图像理解与生成」共找到 2970 篇相关文章
32个随机数字,1分钟推演地球未来15天丨谷歌DeepMind
谷歌DeepMind发布WeatherNext 2,运行速度比上一代快8倍,分辨率达小时级。其关键是新提出的FGN功能生成网络,通过输入32个随机数字生成多样天气情景,速度快且准确率高,虽有小瑕疵但实用。
专治AI生图「人脸崩坏」,8倍速碾压GPT!新版FLUX.1多方位刷新SOTA
FLUX.1 Kontext是融合即时文本图像编辑与文本到图像生成的新一代模型,支持文本与图像提示,角色一致性强,速度快达GPT - Image - 1的8倍。它能解决AI生图“人脸崩坏”等问题,评估显示性能优异。
打破具身世界模型可执行性鸿沟 !港中深-跨维智能团队提出EVA框架,用强化学习让视频世界模型真正“动”起来
近期,利用视频生成模型为机器人构建“世界模型”成热门路线,但存在“可执行性鸿沟”。港中深 - 跨维智能团队提出 EVA 框架,用强化学习优化视频生成,实验显示其能提升视觉规划、仿真任务成功率及真实部署稳定性,还有数据合成潜力。
AI水论文封一年,署名连坐!arXiv最严新规来了,陶哲轩附议
arXiv计算机科学版块主席公布新规,上传AI水论文被查实者封禁一年,后续投稿须先同行评审。若有未核查LLM生成内容证据,署名作者连坐。陶哲轩附议,指出论文生成易、消化难,新政方向正确,但治不了学术‘争先为首’病根。
谷歌新版Gemini一夜端掉UI:单HTML文件复刻macOS,成功率100%
谷歌新版Gemini 3.0 Pro能力惊人,几行提示词就能在浏览器复刻苹果macOS,还能生成网页版Windows、Linux,功能完整且能一次生成,代码已公开。不过有网友指出这只是模拟环境。业内推测其或在未来几个月发布。
42%的代码是AI写的,可96%的开发者不信它:谁敢拍板说“上线”?这成了2026年最大挑战
Sonar《开发者代码现状调查报告》显示,72%开发者每天用AI编码,42%代码由AI生成或辅助完成,但96%开发者不信任。AI虽加快代码生成,却拖慢审核等后续流程,还带来新的低效工作。企业需建立审核体系,正视代码信任危机。
扩散语言模型写代码!速度比自回归快10倍
Inception Labs推出基于扩散技术的大语言模型Mercury,它突破自回归模型限制,生成速度快,还解决了难以回头调整的问题。实测显示其代码生成速度比传统工具最多快10倍,且有强大纠错能力,但面临与当前CI能力不匹配问题。
陶哲轩用GPT-5解决数学难题:仅29行Python代码
陶哲轩最新发帖称,GPT - 5帮他解决MathOverflow上的问题,证明序列lcm(1,2,…,n)并非高度丰数的子集。他与GPT - 5沟通生成参数,并用其生成的29行Python脚本验证,且未遇AI幻觉问题。这不是他首次用AI解题。
为什么说多模态是推荐系统破局的关键?来自饿了么一线的实战复盘
文章围绕多模态推荐展开,从传统推荐算法演进到多模态表征技术,结合饿了么场景实践,还探索生成式推荐。介绍多模态推荐挑战与代表性工作,梳理表征技术发展,详述饿了么系统设计与训练,分析生成式推荐方案及业界路线。
AI证伪百年数学猜想被打假!Lean证明惊现漏洞,哥大教授破防了
OpenAI新推理模型取得十项数学进展,如证明非Sofic群存在性等。哥伦比亚大学副教授Henry Yuen对其量子并行重复定理证明既兴奋又失望,因证明有AI味且难理解。此外,Lean证伪科拉兹猜想被指利用内核漏洞,专家提醒Lean验证有局限。