「交互式视觉推理」共找到 2593 篇相关文章
清华SageAttention3,FP4量化5倍加速!且首次支持8比特训练
清华大学陈键飞团队提出针对BlackWell架构的SageAttention3,实现5倍于FlashAttention的推理加速,首次支持8比特训练。在多种大模型上保持端到端精度,代码将分别于6、7月开源。
5000次风暴,谷歌训出AI预言家!天气预报ChatGPT时刻?
谷歌DeepMind与谷歌研究团队推出交互式气象平台Weather Lab,共享人工智能天气模型。其新模型在热带气旋路径预测上刷新SOTA,是首个超越主流物理模型的AI预测模型,有望拯救数万生命。
对话灵感实验室:全帧率 VLM、低成本与分层部署,业务现场不止需要炫技模型
InfoQ对话格灵深瞳灵感实验室,探讨多模态大模型下视频理解问题。指出传统视频模型抽帧处理浪费算力和信息,介绍LLaVA - OneVision - 2.0突破长视频理解瓶颈,还提及“视觉智能工坊”助力业务落地。
独家|美图入局 Visual Agent,Chance AI 完成数百万美元天使轮融资
美图布局下一代视觉 AI 入口,领投 Visual Agent 创业公司 Chance AI 数百万美元天使轮融资。该公司成立于 2025 年 8 月,从北美大学生切入,有独特产品逻辑,融资后将推进多方向发展。
哈萨比斯:DeepMind才是Scaling Law发现者,现在也没看到瓶颈
哈萨比斯在Axios AI+峰会上称Scaling Law最早由DeepMind发现,靠它可能达成AGI,还预测未来12个月AI发展,如多模态融合、视觉智能突破等,且Gemini目标是成通用助手。
百度Qianfan-VL,发票/图表/合同等PDF识别94.75%刷新纪录!
当前主流视觉 - 语言模型在企业级应用有难点,百度千帆团队提出Qianfan - VL系列多模态大模型,在通用和企业级任务表现出色,基于自研芯片训练,还提供框架与管线降低成本。
GPT-5:我更强了,就这?“看不见”的升级
OpenAI 发布 GPT - 5,它未带来 AGI 相关的震撼升级,而是更注重实用。其训练有新特点,具备推理强、编程能力提升等特性,是 AI 从‘模型炫技’到‘产品体验打磨’转变的标志。
先别急着给OpenAI加冕!陶哲轩:这种「金牌」,含金量取决于「赛制」
OpenAI 官宣推理模型在 IMO 获金牌水平成绩,此前各模型表现不佳。数学家陶哲轩劝谨慎看待,认为无严格测试条件难比较 AI 与人类。网友看法不一,模型训练方法及 Alexander Wei 受关注。
打破长视频理解瓶颈:HoPE混合位置编码提升VLM长度泛化能力
如今视觉语言模型在长上下文任务表现不佳,CMU和小红书团队深入研究,首次提出多模态RoPE扩展策略理论评估框架,指出现有泛化能力不足原因,提出HoPE大幅提升VLM长度泛化能力。
AI数学能力暴涨100%,自进化直逼RL极限!CMU新作颠覆认知
数据枯竭成AI发展瓶颈,CMU团队提出SRT方法,让LLM自我进化,提升数学与推理能力,性能逼近传统强化学习。研究还分析其局限,提出缓解奖励作弊策略及应对模型崩溃的方法。