「像素级生成」共找到 2986 篇相关文章
Ilya重磅发声:Scaling时代终结!自曝不再感受AGI
Ilya在与主持人Dwarkesh Patel的深度访谈中爆出惊人观点,认为Scaling时代已终结,我们正走向研究时代。他指出当前技术路线后劲不足,模型泛化能力远逊人类,还探讨了AI发展的诸多关键问题。
AAAI 2025 Oral | 火山引擎多媒体实验室提出VQ-Insight,AIGC视频画质理解大模型
火山引擎多媒体实验室与北大合作论文《VQ-Insight: Teaching VLMs for AI-Generated Video Quality Understanding via Progressive Visual Reinforcement Learning》入选AAAI 2026口头汇报。VQ - Insight用渐进式框架处理AIGC视频画质理解,实验表现卓越。
AI Native 的影像公司们,颠覆赛道的机会来了!
文章指出过去50年影像公司通过推动坐标点向「计算」端移动创造商业变量。如今计算突破天花板,带来理解、增强、生成现实三层价值释放,解锁新场景,AI Native影像公司机会巨大。
NeurIPS 2025|VFMTok: Visual Foundation Models驱动的Tokenizer时代来临
传统视觉 Tokenizer 存在缺乏高层语义信息、冗余度高、表征混乱等问题。香港大学 CVMI Lab 和阶跃星辰 AIGC 团队提出 VFMTok,用预训练视觉基础模型构造视觉 Tokenizer,实验显示其性能优异。
Karpathy盛赞DeepSeek-OCR“淘汰”tokenizer!实测如何用Claude Code 让新模型跑在N卡上
DeepSeek发布新模型DeepSeek - OCR,在实用场景达SOTA且token消耗最少。Karpathy赞其或淘汰tokenizer,Pleiasfr联合创始人称是里程碑。开发者Simon用Claude Code让模型在NVIDIA Spark上跑通。
Langchain回应OpenAI:为什么我们不做拖拉拽工作流
OpenAI发布可视化工作流构建器AgentKit,LangChain创始人Harrison Chase写文解释为何不做。他指出工作流与智能体不同,可视化工作流构建器有门槛高、难管理等问题,还给出不同复杂度问题的解决方案。
节前重磅:开源旗舰模型新SOTA,智谱GLM-4.6问世
国庆前智谱AI发布新一代旗舰模型GLM-4.6并将开源,它在多方面提升,如编码、上下文长度等,评测性能佳,token消耗降低。经实测,其代码、研究、开发等能力强,成全球开源AI领域重要力量。
OpenAI最新硬件2026年底亮相!狂挖苹果20+老将,首款神秘设备或将颠覆iPhone
OpenAI硬件野心浮出水面,收购io后从苹果挖来二十余名工程师,预计2026年底推出首款消费级设备。它还利用苹果供应链,同时在算力上投入巨资解决瓶颈问题。
万万没想到,大学生都开始拿AI来养猪了
夸克在中国人民大学分享会曝光大学生使用情况,每10个大学生中有7人用夸克,AI渗透率达80%。学生不仅用其学习,还用于生活。不过夸克高考曾出现信息错漏,后已修正。
首个MCP架构、只50行代码就能实现高效RAG的开源框架UltraRAG 2.0
检索增强生成系统(RAG)复杂度提升,使科研人员面临高昂工程实现成本。清华大学、东北大学、OpenBMB等联合推出UltraRAG 2.0,基于MCP架构,降低技术门槛与学习成本,让科研专注创新。