「大模型输出」共找到 9323 篇相关文章
对话上交大程远:AI的终局不在云端,而在“感算一体”的物理世界
文章围绕端侧 AI 展开,以上海交通大学程远研究为例,探讨其技术方向“感算一体”,还提及 Agentic AI 热潮,对比其与大模型热区别,阐述端侧与云端关系,及光计算等底层硬件创新对智能设备的影响。
给文档质量"打分":DIQA-5000 数据集与融合版面语义的 DocIQ 质量评估模型
文档图像质量评估(DIQA)是评判‘增强算法有没有把图变好’的关键工具。过去研究多围绕自然图像,缺文档专用数据集。本文提出DIQA - 5000数据集和DocIQ模型,补齐缺口。
ICLR 2026|滑铁卢大学联合可灵提出UniVideo:统一视频理解、生成、编辑多模态
滑铁卢大学与快手可灵团队提出 UniVideo,是支持视频理解、生成与编辑的多模态模型。它采用双流架构,结合 MLLM 与 MM - DiT 能力,统一 10 个多模态任务,在多项基准超现有方法,代码已开源。
AI 模特时代到来:字节x清华推出商用级视频换装模型DreamVVT,保真度显著领先SOTA
字节跳动智能创作团队联合清华推出视频换装模型DreamVVT,基于Diffusion Transformer构建,用两阶段设计解决复杂场景痛点,支持多种输入,在保真度和时序稳定性上领先SOTA。
AI x 大前端性能稳定性:快手亿级 DAU 下的智能诊断实践
本文整理自快手移动端稳定性负责人李锐在 2025 年 QCon 大会的分享。介绍快手大前端性能稳定性挑战,阐述借助「柯南 AI」赋能排障的实践,含根因排障和应急处置案例,还谈了开发中思维切换等认知。
百度0.9B参数模型登顶全球第一,聊聊PaddleOCR-VL背后的技术细节
百度PaddleOCR-VL模型仅0.9B参数,在OmniDocBench V1.5榜单获92.6分全球第一,在多能力维度达业界最佳,能处理109种语言。其采用两阶段架构,结合优质训练数据,实现高性能与低内存、快速度的平衡。
CVPR Highlight|让无人机学会自己认路+锁位目标,国防科大给出一套新解法
国防科技大学 SAW Lab 团队联合多高校推出无人机实时地理定位系统「PiLoT」,首次仅靠单目 RGB 序列在 GNSS 拒止环境完成无人机及目标定位,性能达先进水平,成果被 CVPR 2026 接收。
Sora连更三大新功能!一键打造IP形象,限时免注册码抢占安卓市场
Sora连更三大新功能,包括角色客串、视频拼接、社区排行榜。Sora APP在美国等四国限时取消邀请码限制,卡在安卓版上线节点,意在抢占市场。其角色客串功能可打造IP,转变为社交平台。
刚刚,OpenAI拿下IOI金牌,仅次于前五名人类选手!参赛推理模型才夺得IMO金牌
2025年国际信息学奥林匹克(IOI)中,OpenAI推理模型获金牌,在AI参赛者中排第一,得分仅落后5位人类选手。其未专门训练,成绩较去年大幅提升。此前它在IMO也获金牌级别成绩。
vivo发布端侧多模态模型,只有3B可理解GUI界面,20项评测表现亮眼
vivo AI Lab发布端侧多模态模型BlueLM - 2.5 - 3B,融合文本与图文能力,支持长短思考模式切换。它在20余项评测中表现出色,参数量小,训练和推理成本低,有精巧结构、高效策略,还有高质量数据和高性能平台支撑。