知识扩散」共找到 729 篇相关文章

算法论文7

手机上实现AI视频实时生成,DiT模型上移动端

扩散变换器在视频生成任务性能强,但计算成本高,在手机上难实用。Snap提出创新优化法,加速视频生成,能在iPhone 16 Pro Max上每秒超10帧,不过也存在细节退化等局限。

带你学AI
算法论文8

LeCun发布最新世界模型:首次实现16秒连贯场景预测,具身智能掌握第一视角!还打脸用了VAE

LeCun团队推出PEVA模型,让具身智能体学会人类“预判能力”,首次实现16秒连贯场景预测。它结合结构化动作表示与条件扩散Transformer,用真实数据训练,解决长时序问题,还能筛选最优动作。

量子位
推荐文章8

提示工程实战指南:从Zero-Shot到Graph Prompting,7大核心技术全解析

随着大型语言模型发展,提示工程成关键技能。文章介绍零样本提示、少样本提示等七种提示优化模式,分析适用场景、优缺点,还给出示例,最后总结各技术适用场景及最佳实践。

OpenMMLab
算法论文8

全球顶尖AI做物理,被人类按地摩擦?不懂推理大翻车,本科生碾压

港大等机构用3000道物理题测试顶尖大模型,如GPT - 4o、Claude 3.7 Sonnet等,结果模型准确率远低于人类专家。研究推出PHYX基准测试,揭示模型依赖知识、公式和模式匹配,缺乏真正物理理解。

新智元
算法论文8

AI长身体,直接做实验!自主通用科学家,科研界的Scaling Law来了

本文探讨未来科研范式「自主通用科学家」(AGS),它将AI与机器人技术结合实现科研全流程自动化,有望突破人类科研限制,引发科学范式变革,还介绍了相关架构、优势及面临的挑战和应对策略。

新智元
新闻资讯8

看完智平方创始人郭彦东的这场演讲,我对 VLA 又有信心了

2026年具身智能赛道技术路线引争论,“VLA时代终结”论调扩散。智平方创始人郭彦东演讲回应,称VLA时代未终结,世界模型汇入VLA,关键变量是类脑架构,智平方技术成果和开源平台也证明VLA有生命力。

AI科技评论
产品应用7

Vibe Coding 有了,Vibe Design 呢?Lovart 让不会设计的人也能输出专业素材

作者用 AI 编程一年多,但标签页表情包提醒自己不是设计师。现有生图工具生成的 PNG 不能直接当 logo 用,而 Lovart 打通从 PNG 到 SVG 的路,让无设计知识的人也能输出专业素材。

AI产品自由
产品应用8

让问题不过夜:交易领域“问诊”Agent实践

文章针对研发支持中的痛点,构建智能Agent系统,将问题抽象为业务答疑与问题诊断两类能力。介绍了系统架构、构建演进、知识体系、质量评估等内容,还展示实战成效,指出当前边界与下一步方向。

阿里云开发者
开源动态8

英伟达世界模型再进化,一个模型驱动所有机器人!机器人的GPT时刻真正到来

英伟达GEAR实验室提出DreamZero,是基于预训练视频扩散骨干网络的世界动作模型,有140亿参数,能让机器人通过文本提示完成未见任务。它解决了传统模型问题,在多方面表现出色,代码已开源。

机器之心
开源动态8

LTX-2开源:首个能同时生成视频和音频的模型

LTX-2开源,它是Lightricks团队开发的首个开源多模态基础模型,能联合生成音频和视频。采用非对称双流扩散变换器架构,用深度多语言文本编码器,速度比许多纯视频开源模型快,让模型理解声画关联。

AI工程化