等变建模」共找到 8385 篇相关文章

开源动态8

带图推理碾压同类开源模型!港中文微软开源OpenThinkIMG框架,教AI学会使用视觉工具

港中文、微软联合推出OpenThinkIMG开源框架,解决AI使用视觉工具面临的集成难、缺数据、适应差问题,还公开核心技术V - ToolRL。该框架在图表推理任务上表现超GPT - 4.1,为下一代AI智能体提供基础。

量子位
算法论文8

AAAI|东方理工陈云天:教会视频扩散模型“理解科学现象”,从初始帧生成整个物理演化

东方理工陈云天团队在论文中提出让视频扩散模型学习“潜在科学知识”的框架,方法分三步,在流体和台风数据实验中表现超主流方法,展示生成式AI在科学建模的探索。

力学与人工智能
算法论文8

更少的token生成更好的图!香港大学联合阶跃星辰让AI绘画真正理解了再画

香港大学、阶跃星辰用VFMTok新方法,让图像生成模型借用顶级视觉AI的眼睛看世界,实现更快、高质量图像生成,且无需复杂引导技巧。它改图像理解方式,将像素死记硬背转为语义理解。

AIGC开放社区
算法论文8

上交大智能计算研究院论文:不只算对答案,大模型如何真正学会运筹建模丨ICLR 2026

上海交大智能计算研究院提出 StepORLM,通过生成式过程监督提升运筹建模可靠性。研究反思传统训练范式局限,在多数据集测试中,小参数的 StepORLM 表现超大型模型,还分析现有方法缺陷并提出解决框架,有重要方法论和应用意义。

AI科技评论
算法论文8

浙大&港理工提出InfiGUI-R1:利用强化学习,让GUI智能体学会规划任务、反思错误

多模态大模型驱动的GUI智能体有潜力,但现有智能体面对复杂任务力不从心。浙大机构提出InfiGUI-R1及Actor2Reasoner框架,通过两阶段训练提升智能体能力,InfiGUI-R1-3B在多基准测试中性能卓越,为GUI自动化工具开辟新道路。

机器之心
算法论文8

GPT-4o-Image仅完成28.9%任务!上海AI实验室发布图像编辑新基准,360道人类专家严选难题

上海人工智能实验室团队针对图像编辑AI提出问题,推出RISE任务及配套评测基准RISEBench。测试九个视觉编辑模型,结果显示当前模型完成复杂指令能力欠缺,闭源与开源差距大。

量子位
算法论文8

ICML 2026 | 大模型为什么算不对加法?南大团队提出本位和轨迹,揭示LLM算术错误的几何机制

南大团队研究LLM在多操作数加法中的内部表征结构,发现算术状态呈高度结构化几何流形。提出本位和轨迹与噪声量化模型,解释模型算错加法原因,还设计推理时纠错方法。

机器之心
算法论文8

仅保留35% Token,性能反超原模型!快手可灵用视觉信息引导音频压缩,推理时间直降42%

Omni - LLM计算浪费严重,快手可灵团队提出OmniSIFT框架。它利用音视频非对称依赖关系,通过时空联合剪枝压缩视频、视觉引导筛选音频Token,大幅减少Token数量,提升性能和推理效率。

量子位
算法论文8

ICLR 2026 | 当视频难以被表征:UCSD、HKUST机构联合提出FlowRVS,用生成式流匹配重构视觉感知范式

计算机视觉领域传统表征方法在视频处理上力不从心,SGIT AI Lab机构团队提出FlowRVS,跳出传统桎梏,用生成式流匹配重构视觉感知范式,实现SOTA提升,还展现诸多优势,证明Flow Matching理论普适性。

机器之心
新闻资讯8

首个智能体商业信任协议来了!支付宝携手千问 App、淘宝闪购发布 AI 商业协议 ACT

1 月 16 日,支付宝联合千问 App 伙伴发布 ACT 协议,它是中国首个面向 Agent 商业需求的开放技术协议。该协议打造 AI 与服务平台‘通用语言’,解决授权、安全问题,让操作更放心,还降低商家对接成本。

InfoQ