「学术视频自动化」共找到 1566 篇相关文章
构建会思考的测试Agent:从自动化到自主智能的演进
文章介绍面向企业级软件测试的质量数字人系统,结合大语言模型等实现从传统到自主智能测试跨越。分析专有云测试困境,指出通用AI Agent平台局限,阐述系统设计、能力及架构,展示应用成果并展望扩展场景与未来计划。
全美60万岗人类出局,三年暴省126亿!机器人大军入厂
亚马逊一边宣布扩招25万人,一边计划让机器人取代超60万个岗位,到2033年实现75%运营自动化。此举三年可省126亿美元,但会使人类劳动价值边缘化,自动化趋势或蔓延各行业。
让龙虾看懂屏幕!谷歌多模态新成果,文本图像视频音频进同一空间
谷歌发布首个原生多模态嵌入模型Gemini Embedding 2,将文本、图像、视频、音频和文档映射进同一嵌入空间,支持多模态混合输入,为AI Agent“看懂”世界提供关键基础,已展开公测。
不愁了!开源智能体Paper2Poster「一键生成」学术海报
2025年5月,滑铁卢大学等团队发布Paper2Poster系统,用大模型将论文自动生海报。它提出PosterAgent多智能体方法,分解析、规划、绘制优化三阶段,生成效果好且开源,不过也存在效率和创意不足问题。
从Sora2到TapNow:AI视频创作,差的是这套专业流程
国内知名导演欧阳英豪用AI打造百万级商业TVC,TapNow公开其创作流程。当下AI视频工具强,但能用于商业的TVC少,核心问题是不懂专业流程。TapNow将专业流程工具化,有五大核心功能,适合不同层次创作者。
让AI自我进化?斯坦福华人博士答辩视频火了,庞若鸣参与评审
斯坦福大学博士生 Zitong Yang 完成「持续自我提升式 AI」博士论文答辩并分享视频。他针对当前模型局限提出解决方案,涵盖合成持续训练、预训练能力自我提升、迈向 AI 设计 AI 三个核心方向,引发行业关注。
浙大联手字节:开源大规模指令跟随视频编辑数据集OpenVE-3M
浙江大学与字节跳动合作,提出大规模指令跟随视频编辑数据集 OpenVE-3M,有 3M 样本对。还提出数据构造管线、编辑模型 OpenVE-Edit 及评测集 OpenVE-Bench,小参数量下超越现有开源模型。
OpenAI完成资本重组,奥特曼宣称28年实现完全自动化AI研究员
昨晚,OpenAI宣布完成资本重组,简化结构,非营利的OpenAI基金会持股营利性OpenAI Group 26%。未来基金会将在健康与AI韧性技术发力,投入250亿美元。奥特曼称2028年实现全自动AI研究员,还公布与微软新合作协议。
手机操控革命!开源手机AI Agent,自然语言操控Android/iOS!
传统移动设备自动化工具难实现自然语言控制和跨应用交互,开源项目Mobile - Use提供解决方案。它由Minitap AI开发,能通过自然语言指令实现设备UI感知自动化,功能丰富,应用场景广。
无代码产品功能设计不要盲目追求AI自动化|对话影刀AI Power
量子位智库对话影刀AI Power产品经理该汗,探讨AI自动化产品开发。影刀AI Power定位企业场景,具多功能,能提高业务效率。交流涉及场景适配、差异化路径、功能布局等问题,还分享付费转化等看法。