图中文字」共找到 2921 篇相关文章

算法论文8

华为科大联创大模型低比特量化算法,1‰数据实现昇腾无损压缩7倍

华为诺亚方舟实验室联合科大提出CBQ后训练量化方案,仅用0.1%训练数据实现大模型7倍压缩,保留99%精度。该成果登ICLR 2025 Spotlight,已加入昇腾ModelSlim工具包。

新智元
产品应用8

Qwen-Image-2.0: 字字清晰,张张细腻

阿里云推出Qwen-Image-2.0像生成基础模型,具专业文字渲染、细腻真实质感等特色。在AI Arena盲测表现优越,能精准生成复杂内容,文字渲染有准、多、美、真、齐特点,像编辑能力也得到增强。

千问Qwen
推荐文章8

11篇顶会论文之外,美影像研究院做了一件事:让大众爱用AI

过去两年,AI 生成片、视频变得容易,但让 AI 理解并按创作者意创作很难。美影像研究院过去几年围绕高频创作场景痛点展开研究,11 篇论文被国际顶会接收,成果通过产品落地转化为 AI 影像能力。

机器之心
算法论文8

ICLR 2026|原生多模态推理新范式ThinkMorph ,让文字像在统一架构共同演化

NUS、ZJU 等联合提出「ThinkMorph」,主张文字像在统一架构「原生协作」。仅用 2.4 万条数据微调 7B 统一模型,视觉推理平均提升 34.74%,多项任务比肩或超 GPT - 4o 和 Gemini 2.5 Flash,还涌现新能力。

机器之心
算法论文8

BIGAI & 科大团队提出 MILR: 测试时隐空间推理,让像生成学会「边想边改」丨ICLR 2026

BIGAI与科大等团队提出MILR,通过测试时隐空间推理,在不更新模型参数下优化文表示,提升复杂像生成能力。该方法在多基准测试达SOTA,还探讨了测试时扩展与奖励模型,未来有诸多拓展方向。

AI科技评论
算法论文8

大模型听懂语音却反而变笨?港深与微软联合解决语音大模型降智问题

从GPT - 4o开启全能交互时代后,Speech LLM面临“模态推理鸿沟”问题,输入从文本变语音,推理能力显著衰退。港深与微软联合提出TARS框架,通过三项创新解决此问题,实验显示推理能力100%复原。

机器之心
算法论文7

JCP | 科院力学所孙振旭研究员团队:关于物理信息神经网络的预处理:如何在流体力学更好地利用数据

物理信息神经网络(PINNs)为求解微分方程正反问题提供灵活框架,但数据预处理领域待探索。本文提出数据预处理方法,通过对数据和方程归一化,在四个湍流案例提升PINNs流场重建预测准确度,不增计算成本。

力学与人工智能
产品应用8

AI真有希望考清北了!豆包1.6多模态推理发威,闯关数理化带大题

火山引擎原动力大会发布豆包大模型1.6,它是国内首款多模态SOTA模型,支持256k上下文长度。实测它解答高考数理化带大题表现出色,还具备像识别、视频理解、GUI操作等能力。此外,火山引擎还推出系列工具和平台助力企业。

新智元
开源动态8

大 × MBZUAI重磅开源!A₁:全透明高效 VLA 模型,机器人实时控制成本直降 76% 丨CVPR 2026 Findings

开放世界机器人操作被大模型算力成本和推理延迟难题困住,大与MBZUAI团队推出全开源的A₁模型,其自适应推理方案降低推理延迟和骨干计算量,性能超主流基线,打破‘高性能=高成本’魔咒。

AI科技评论
产品应用7

给 AI 一张陶罐碎片,它能还原破裂过程吗?Minimax H3 vs Seedance 2.0 Fast 实测

文章实测 MiniMax H3 和 Seedance 2.0 Fast,给模型一张破碎陶罐,让其生成破碎过程视频。分析 H3 技术逻辑,对比两模型效率、质感和物理细节等差异,指出开放与闭源模型的特点及视频模型待解决的问题。

AI科技评论