「像素级生成」共找到 2999 篇相关文章
清华发布世界模型评测新标尺:直击机器人感知与行动鸿沟
清华大学等机构推出 WorldArena 评测基准,用于测试 EWM 真实能力。它融合感知与功能评估,含十六项视频指标,结合主客观评价生成 EWMScore。测试揭示模型在感知与行动上的差距,转型为实用型模型是行业挑战。
阿里Qwen3.5小模型发布:0.8B参数就能处理视频,边缘AI时代真的来了
阿里通义千问发布Qwen3.5系列四款小模型,采用Gated DeltaNet混合注意力机制。有原生多模态设计,解决“内存墙”问题。在多基准测试中表现出色,开发者反响好,但也存在幻觉级联、调试局限等问题。
字节开源GUI Agent登顶GitHub热榜,豆包手机核心技术突破26k Star
字节开源的豆包手机核心支撑GUI Agent模型UI - TARS登顶GitHub热榜,突破26k Star。它是多模态AI智能体,纯视觉驱动,部署简单,历经多轮迭代,成为热门开源多模态Agent。
就业恶化AI不背锅!经济大周期下AI取代的技能依然很重要
研究表明就业市场恶化早于生成式AI普及,高AI暴露职业失业风险在2022年初就上升。毕业生求职困境源于宏观经济周期,且掌握与AI能力重叠技能,在后ChatGPT时代反而能提升起薪、缩短求职期。
3D领域的NanoBanana也来了,万物皆可用嘴操控。
3D领域的hyper3D推出Rodin Gen - 2,是首个能用嘴编辑3D模型的AI 3D产品。用户可上传三方模型修改编辑,还能图生3D。用嘴改3D能做局部可控修改,适合专业生产管线。
飞猪搭建系统演进:从人工运营到多Agent协同搭投生产
飞猪移动端页面搭建体系从初代寄生于阿里集团平台,发展成“搭投”体系。但传统人工选搭投模式待优化,为此启动AI智能搭投升级专项,构建新范式,还介绍产品结构、技术实现及后续规划。
三维空间太难懂?RoboTracer让机器人理解复杂空间指令,推理3D空间轨迹,开放世界也能精确行动
家庭环境复杂,让机器人理解空间指令难,现有VLM多聚焦2D推理。北航、北大等联合推出多模态大模型RoboTracer,能精准生成3D轨迹,在多项评测中领先,还能直接集成到机器人,完成复杂任务。
当 GPU 成为主角:解锁 AI 集群中那 85% 的闲置 CPU 算力
全球AI算力规模增长,GPU成主角,但GPU满负荷运转时CPU利用率低,传统调度机制无法保障优先级,造成资源浪费。TencentOS如意(RUE)的在离线混部技术改造Linux内核调度体系,高效释放算力。
都快2026年了,机械硬盘居然涨价了
消费电子市场未获AI利润,先遭冲击。因AI基建对存储需求大,内存、闪存颗粒及机械硬盘纷纷涨价。机械硬盘出货量十年来首增,价格回升,厂商借此控产保利润,消费级产品也受影响。
Lovart:设计界的Cursor,NanoBanana Pro遇上真正的Design Agent
Google的Nano Banana Pro能力亮眼,但作为设计工具商用不足。Lovart像设计界的Cursor,提供专业化设计工作流,是可用的Design Agent。文中通过案例展示其编辑能力,还介绍了PPT生成等功能及圣诞活动。