「多模态强化学习」共找到 2302 篇相关文章
谷歌年度大招:所有AI模型全升级一遍!Gemini2.5大杯中杯霸榜前二,新版视频/图像模型亮相
谷歌在I/O大会放大招,升级所有AI模型,重做原有产品,推出诸多实验性新产品。如Gemini 2.5系列升级,具备新功能;还有异步代码助手Jules、新搜索模式等,多模态模型也全线升级。
The Batch: 981 | Ox Alpha 被揭晓为 GLM-5.3-Flash
本文是DeeplearningAI The Batch专栏的AI行业资讯,揭秘此前匿名上线爆火的Ox Alpha模型,公开其为Z.ai推出的GLM-5.3-Flash,详细介绍该模型的架构、性能、定价与授权信息。
如果你的大学不提供 Token,应该立即退学
本文站在学生角度探讨 AI 时代大学生学习问题。认为高校在 AI 教育上滞后,不提供 Token 不合理。强调学生应善用 AI,具备问题意识、判断力和品味,还给出了使用 AI 的具体建议。
寻明生科获1亿美元B轮融资,加码基座模型开拓AI药物发现新边界 | 5Y News
近日,寻明生科宣布完成1亿美元B轮融资,累计近2亿美元。资金将投入生物基座模型研发与规模化训练,升级Lab - in - the - Loop体系。该公司构建闭环AI原生基础设施,其模型能力获验证,商业变现多元。
Qwen3.8-Max:编程与办公,全面跃升
今日正式发布Qwen3.8-Max,下周将开源其及Qwen3.8 - 27B模型权重。它参数达2.4万亿,在多方面全面提升。开发者可通过千问AI平台获API服务,性价比高。在编程、办公等场景表现出色,用户反馈良好。
Agnes AI 实测:AI 编程真正的瓶颈,99%的人想错了
本文实测Agnes AI,指出AI编程瓶颈在于缓存命中率,而非模型智商。介绍其产品线、评测成绩与价格优势,还分享客户端体验,包括亮点、回滚事故及日志结论,最后点明智能免费后验证更稀缺。
一个开源平台,编织起了Agent「互联网」
如今 Agent 单体能力强但系统分散,开源平台 Octo 应运而生。它由明略科技打造,可聚合 Bot,让其成为企业级资产。Octo 重写协作,有 Matter 沉淀任务,塑造 Taste 让 Agent 更懂用户,还有六种协作模式。
对话灵感实验室:全帧率 VLM、低成本与分层部署,业务现场不止需要炫技模型
InfoQ对话格灵深瞳灵感实验室,探讨多模态大模型下视频理解问题。指出传统视频模型抽帧处理浪费算力和信息,介绍LLaVA - OneVision - 2.0突破长视频理解瓶颈,还提及“视觉智能工坊”助力业务落地。
VLA模型为何忽视语言?破解指令跟随幻觉,分布外场景泛化新突破
当前VLA模型常依赖视觉线索而非语言指令,导致新场景表现不佳。论文提出LangForce方法,引入对数似然比损失,强化模型对语言的依赖,提升分布外泛化能力,还保留语言核心功能。
刚刚,阿里「欢乐马」正式上线,抢先实测这匹「黑马」
4月27日,阿里ATH团队上线视频生成模型HappyHorse 1.0。它依托多模态架构,音视频创作编辑一体,价格实惠。支持文生、图生、多图参考生视频,视频编辑功能强大,能精准替换主体、添加元素、改变风格。