「指标驱动」共找到 874 篇相关文章
绝美无痕,比你还会P图的Agent!仅通过自然语言指令,灵活使用数百工具,超越GPT-4o达60%
JarvisArt提出多模态大模型驱动的智能Agent,通过理解自然语言指令,协调200+个Lightroom工具,实现媲美专业修图师的非破坏性编辑。其内容保真度超越GPT - 4o达60%,为AI艺术创作开辟新路径。
夯,还真的很不错,8.2k Star scroll-world,太丝滑~~~~
许多官网滚动特效不佳,scroll - world 让滚动驱动无切镜的品牌旅程。它通过生成镜头链、对齐接缝实现沉浸体验,还给出适用场景和接入方式,虽非零成本但复用了经验。
太魔幻了!刚刚OpenAI发布GPT Image 1.5:Nano Banana Pro 王座不保
OpenAI发布由GPT Image 1.5驱动的新版ChatGPT Images。新模型核心升级体现在精准修图、指令遵循能力强、生成速度提升4倍。还推出Images主页,API上线且价格降20%,适合企业。
ACMMM 2025 | 北大团队提出 InteractMove:3D场景中人与可移动物体交互动作生成新框架
北大团队在ACMMM 2025发布InteractMove,首次提出含可移动物体3D场景中基于文本的人 - 物交互生成任务,构建数据集与创新框架,在多指标领先,代码与模型已开源。
一杯拿铁3毛8,Gemini 3.1联手GPT-5.5干黄咖啡馆!2个月烧光21万
Gemini 3.1 Pro驱动的AI店长Mona掌管咖啡馆,对顾客请求来者不拒,疯狂采购,致两个月亏3万美元。换GPT - 5.5后走向另一极端,虽有账面利润但生意做死,AI开店仍有问题。
拒绝不必要Think:微软&北大提出第一种自适应大型混合推理模型
大型推理模型冗长思考开销大,微软研究院和北大提出大型混合推理模型(LHRMs),它能依查询上下文决定是否思考。介绍了两阶段训练流程、评估指标,实验显示其超越现有模型且效率高。
多人会话视频生成新突破:香港科技大学,浙江大学用单人数据实现多人交互视频生成
香港科技大学、浙江大学等开源 AnyTalker,提出音频驱动多人交互生成新范式。它用创新机制和两阶段训练策略,以少量数据实现多人视频生成,还构建评估指标,性能超现有方法。
OpenAI十周年「血色浪漫」:11位联创出走8位,奥特曼深夜发文
OpenAI迎来十周年,发布短片回顾发展。过去11位联创出走8位,奥特曼发文揭秘细节,称吃到时代红利。新晋女高管分享炼成秘诀,如研究驱动产品、自下而上创新、重视安全等。
关于Nsight Compute中Compute Workload Analysis反映的Tensor Pipe Uti的理解
文章分析Nsight Compute中Compute Workload Analysis反映的Tensor Pipe Uti异常现象。通过实验和推算,发现ncu对L20 GPU上特定指令用错误执行延迟算指标,导致异常,还给出GEMM Kernel性能分析建议。
独家对话Sharpa核心团队:如何把人类的“触觉”装进机器人的身体|甲子光年
甲子光年对话Sharpa核心团队,该团队定位是以触觉AI驱动的全栈灵巧机器人公司。团队认为触觉是机器人灵巧操作关键,介绍CraftNet创新,还提及与英伟达合作及公司运营、商业计划等。