「视频渲染框架」共找到 2553 篇相关文章
8B硬刚72B!MiniCPM-V 4.5技术报告正式出炉
行业首个具备“高刷”视频理解能力的多模态模型MiniCPM-V 4.5技术报告发布,提出三项关键技术,使模型在多任务达同级SOTA,8B参数规模超72B模型,推理快,开源后获社区好评。
机器人高层指挥低层做,“坐标系转移接口”一次演示实现泛化学习 | ICML2025
美国东北大学和波士顿动力RAI提出HEP框架,首创“坐标系转移接口”,有极简高效分层结构、空间对称性自然泛化、创新型体素编码器等亮点。它基于分层策略和接口,提升机器人操作灵活性与泛化性,论文被ICML2025收录。
Meta新突破!跨模态生成告别噪声:流匹配实现任意模态无缝流转
Meta与约翰霍普金斯大学联合推出CrossFlow框架,实现跨模态生成新突破。它基于流匹配提出新范式,无需依赖噪声分布等,在多任务上媲美或超最优算法,训练成本低、速度快,还能适配多任务。
Learning from peers!让LRM互相「传纸条」的新协作方式大幅提高准确率和效率
当前主流大模型如QwQ - 32B存在“前缀主导陷阱”,推理开头出错会使准确率暴跌。研究者受“同伴互助”启发提出LeaP框架,设计三种路由策略,实验显示小模型能借此超越大模型,开创了多种可能性。
DeepSeek推理再提速80%,V4正式版定档7月中旬
DeepSeek两天前开源DSpark推理加速框架,已在V4预览版在线服务跑真实流量,使生成速度提升60% - 85%。DSpark化解推测解码问题,在多模型超Eagle3和DFlash。V4正式版7月中旬上线,将引入峰谷定价。
OpenAI突然发布Sora 2:好一个“AI版抖音”!
OpenAI重磅上新,带来依托Sora 2的“AI版抖音”——Sora iOS APP。Sora 2是音视频同步生成模型,更遵循物理定律、可控性强,还能注入现实元素。实测效果佳但画质低,Pro版可改善,后续还会发布API。
iPhone 17 Pro居然能跑8B大模型!
iPhone 17 Pro竟能跑8B大模型,如Qwen3 - 8B,推理较流畅。作者换机一是因eSIM,二为拍视频。其认为AI普及需端侧落地,此机芯片性能是好信号,盼出优质iOS客户端。
OneSearch,揭开快手电商搜索「一步到位」的秘技
本文介绍快手提出的电商搜索端到端生成式框架 OneSearch。它有三大创新,包括 KHQE 模块、用户行为序列注入策略、偏好感知奖励系统。实验显示它在多方面提升显著,已部署于快手电商搜索场景。
腾讯Youtu-agent 不会代码,也能搞定数据分析+深度研究+HTML报告
腾讯开源的Agent框架Youtu - agent灵活高性能,可用于数据分析等多任务。基于openai - agents构建,适配多种模型API等。突出优势是能自动化生成智能体及其配置,采用YAML配置方案,有内置‘元智能体’,还完全异步。
一粒「扣子」,开启了Agent的全生命周期进化
2025年被视为Agent爆发元年,自年初通用Agent产品Manus出现后,其受关注程度空前。火山引擎Force 2025大会上,升级后的扣子成焦点,它从开发平台进化为全生命周期平台,覆盖开发、框架、调优、协作四大部分。