「视频制作」共找到 1079 篇相关文章
苹果新作:内化视觉思考,推理提速 5 倍
Apple研究团队提出Internalized Visual Thinking(IVT),一种将预测性世界建模能力内化到模型表征中的后训练框架。它在训练时预测未来,推理时直接回答,相比Visual CoT推理提速超5倍。
5.9K Star!告别 AI 画图的“廉价感”,这个开源项目让你的图表高级又有品味!
技术写作者兼产品设计师Cathryn Lavery因不满Claude画图效果,开发开源项目diagram - design。它是Claude Code的技能插件,输出自包含HTML文件,有多种图表类型、品牌定制等亮点,解决AI画图审美痛点。
本周 5 个实用的 Github 开源项目,真香!
文章介绍本周5个实用Github开源项目。有资源聚合媒体中心stremio-web,AI原生安全测试平台CyberStrikeAI,本地优先AI编程远控工具hapi,智能股票分析系统daily_stock_analysis,纯前端JavaScript GUI智能体框架PageAgent。
谷歌Gemini杀入全球桶,血洗微软Office!颠覆全球3亿打工人
谷歌官宣Gemini全面升级版Workspace体验,全线接入Docs、Sheets、Slides。在SpreadsheetBench测试中成绩出色,谷歌Workspace更个性化实用。新功能覆盖文档、表格、幻灯片及云盘,还明确数据边界,欲定义下一代办公软件。
光年之外居然做了能用Skills的AI浏览器:超实用实用案例+现成脚本
光年之外团队推出 Tabbit 浏览器,填补国内空白,有对话、妙招等 5 大核心功能。文章用5个案例展示其便捷性,如一键成稿、旅行规划等,还能解决收藏难题、增强网页功能,适配国内网站。
训练机器人方式对了吗?英伟达DreamZero双榜第一新反思
NVIDIA的DreamZero在RoboArena和MolmoSpaces基准测试双登顶。分析文章《Why is DreamZero so good at robotics?》从多维度拆解其表现突出原因,质疑传统认知,如数据量并非万能,模型规模和信息输入方式也很关键。
李飞飞站队LeCun,AGI全是炒作!80分钟重磅爆料出炉
李飞飞在Lenny Rachitsky播客中回顾AI发展,揭秘秘辛。她认为AGI是营销用语,世界模型才是未来十年AI前沿。还谈到ImageNet诞生、机器人困境等,其创业公司World Labs的Marble平台应用广泛。
锁定角色,「多主体」也可控!个性化文生图,给你PS般交互体验
LayerComposer革新个性化图像生成,能让用户如在Photoshop般操控元素位置、大小,解决传统方法交互性与多主体扩展难题。它有分层画布、锁定机制、模型–数据共设计三大特点,实验表现出色,未来将促进人机协同创作。
OmniAvatar震撼开源!阿里夸克开源全新音频驱动角色模型
音频驱动人体动画技术有局限,阿里夸克团队推出OmniAvatar模型。它用逐像素多层次音频嵌入和LoRA训练法,解决唇动同步等问题,适用于多领域,但也存在颜色偏移等不足。
继Harness之后,“龙虾”JiuwenClaw率先开启“Coordination Engineering”时代
AI工程范式迭代快,行业面临‘定义赶不上进化’的焦虑。华为支持的openJiuwen社区发布新版JiuwenClaw,新增多智能体协同能力,提出‘Coordination Engineering’,实测中表现出高稳定性,可自主完成多项任务。