「长视频理解」共找到 2145 篇相关文章
刚刚,机器人练成了宁次的「白眼」:∞帧画面边看边3D重建我们的世界!
蚂蚁灵波开源的LingBot - Map模型实现无尽流,可看∞帧视频稳定实时3D重建。它打破“既要实时、又要记路、还要省显存”的不可能三角,在多项测试中表现优异,补齐具身智能关键拼图。
小米AI语音新框架:人人都能当声音导演
小米大模型应用团队提出Midasheng - audio - generate与Xiaomi Any2Speech两大音频生成框架。前者可实现全场景声音重建,后者让AI学会理解声学空间与叙事逻辑,改变了语音合成应用场景与思路。
盘点2025年全球宕机事件,还有不用AI写代码的公司吗?
2025年Cloudflare、AWS等轮番宕机,“连坐”半个互联网。AI编程全面普及,虽提高效率,但可能让宕机更易发生、难提前发现。宕机最爱发生在变更后,AI编程使改动频繁,还让人类理解系统比例下降。
Karpathy:LLM渴望的不是生存,而是你的点赞
Andrej Karpathy指出人们对‘智能’理解肤浅,动物智能与LLM智能源于不同优化压力。动物智能源于自然选择,而LLM智能来自统计模拟、强化学习微调等,两者在多层面有差异,LLM受商业进化影响大。
Sora连更三大新功能!一键打造IP形象,限时免注册码抢占安卓市场
Sora连更三大新功能,包括角色客串、视频拼接、社区排行榜。Sora APP在美国等四国限时取消邀请码限制,卡在安卓版上线节点,意在抢占市场。其角色客串功能可打造IP,转变为社交平台。
比Qwen3-Max更Max?夸克抢先用上最新闭源模型
10月23日夸克上线对话助手,采用比Qwen3 - Max更优的Qwen最新闭源模型,实现AI搜索与对话深度融合。经测试其搜索、理解、写作等能力出色,技术架构创新,是阿里‘模型即应用’战略体现。
开源共建重塑推理 Infra:从架构创新到生态协同,Mooncake的破局之路
大模型推理落地面临成本、吞吐、长上下文“三角困境”。开源项目Mooncake以“计算存储解耦”为核心,通过PD分离等技术提供底层支撑。直播邀请专家从多视角拆解其技术逻辑、开源价值与企业实践。
“扁平+拓扑”双索引,85页PDF"秒级"推理,MMRag幻觉率骤降76%
多模态长文档视觉问答常见于科研论文等场景,现有技术路线有大视觉 - 语言模型直接端到端和检索增强生成,但各有缺点。MMRAG - DocQA引入新方案,解决多模态连接和跨页证据链接问题。
首钢园社群•邻里Station实战活动课:让AIGC掀起效率革命
7月16日晚,首钢园社群•邻里Station举办“AI视频生成与应用”实战活动课,聚焦AIGC前沿趋势。授课达人展示前沿AI平台案例,还进行多环节教学,剖析行业趋势,首钢园为学习实践提供好环境。
GEO中,llms.txt是个啥?
GEO中llms.txt是新兴网络标准提案,分提案A(访问控制)和提案B(推理指导)。提案A类似robots.txt,控制内容用于模型训练;提案B是Markdown文件,助LLM理解网站。作者整理指南分享,盼业内出标准。