「通用视觉推理」共找到 3106 篇相关文章
AI Infra进阶:如何让大模型输出确定的结果
文章探讨大模型输出确定性结果的问题。指推理引擎底层动态组批与算子调度策略,因浮点加法顺序变化使结果波动。还分析GEMM、RMSNorm等算子影响,给出vLLM实现Batch Invariance的方法。
Agent 的 Token 账单怎么省?
AI 行业从生成式能力向 Agent 行动力跃迁,核心矛盾转向推理成本可控性。随着企业将 Agent 编入自动化流水线,Token 消耗受关注,业界开始聚焦以「降本」为核心的技术路线。
李建忠对话菲尔兹奖得主Timothy Gowers:整个数学研究的范式将被AI改变
奇点智能研究院院长李建忠与菲尔兹奖得主Timothy Gowers对话,探讨AI与数学研究的十个话题,涉及数学重塑AI、AI推理能力、自动形式化、数学研究未来及AI对数学教育的影响等。
与Banana Pro过过招,国产Libcom图像合成工作台开启Labubu漫游记
2025年AIGC热度再创新高,通用图像编辑大模型虽功能强大,但在细分领域有不足。上海交通大学牛力团队推出并升级了Libcom图像合成工作台,与Nano Banana Pro对比,其在图像合成上表现更稳定。
豆包也开始抢程序员饭碗了,首个编程模型来了!
字节给豆包升级编程能力,推出首款编程模型Doubao - Seed - Code。它刷新国内编程模型上下文长度,支持视觉理解,API价格良心。经测试,虽未达全球顶尖,但弥补国产编程模型短板。
AI模型守法率提升11%,港科大首次用法案构建安全benchmark
香港科技大学KnowComp实验室从法律合规视角研究LLM安全,提出「安全合规」新范式。基于法律条文构建benchmark,用GRPO微调Qwen3 - 8B得推理模型,在新benchmark测试中性能提升显著。
从科学论文自动生成视频
该项目解决学术演示两核心问题,用智能体PaperTalker生成视频,还设Paper2Video基准评估。介绍了PaperTalker使用步骤,含环境、配置、推理,也说明了Paper2Video评估指标及运行方法。
Sam Altman自曝羡慕20岁辍学生,还直言美国难以复制微信这类“全能App”!
当地时间2025年开发者日,OpenAI推出系列开发者更新,向通用智能平台转型。会后,CEO Sam Altman接受专访,谈新工具影响、AGI突破,还表示羡慕20岁辍学生,称美难复制微信这类“全能App”。
腾讯重磅开源:端到端文档转换VLM,中英文错误率双料最佳!
腾讯开源端到端文档转换视觉模型POINTS - Reader,可将文档图片转结构化文本。它基于POINTS1.5架构,支持中英文。在OmniDocBench基准上,中英文错误率暂列最佳,具零后处理简单等亮点。
来自MIT最强AI实验室:OpenAI天才华人研究员博士毕业了!
OpenAI华人研究科学家陈博远完成MIT博士论文答辩。他不到4年读完博士,辅修哲学,是GPT图像生成核心成员和Sora视频团队成员,将推进世界模型技术,强调视觉世界模型对具身智能至关重要。