「Qwen2.5 - VL - 7B」共找到 3510 篇相关文章
微软开源3大突破AI Agent模型,仅140亿参数超越DeepSeek-R1
微软研究院开源AI Agent推理模型rStar2-Agent,140亿参数在多测试超6710亿参数的DeepSeek-R1。其通过智能体强化学习,在训练基础、算法、流程上有三大突破,显著提升性能且降低算力成本。
首个为手机而生的通用Agent?!苹果做不到的事,“野路子”智谱抢先实现了
苹果预计2026年升级Siri实现自主行动,但完整落地的执行型Agent仍未推出。8月20日,智谱发布AutoGLM 2.0,宣称是全球首个可在手机用的Agent,开创‘Agent + 云手机 / 云电脑’范式,能代理操作高频应用。
全球首创!B站推出影视级TTS语音模型,支持零样本语音+情绪双克隆,精准时长控制!
近日,B站语音团队推出全新一代语音合成模型IndexTTS2,提供影视级音质、情绪克隆和时长控制。其情绪与时长精细控制功能全球首创,还具备零样本语音克隆等能力,支持本地运行与中英文双语。
马斯克麾下最惨打工人:手滑删掉xAI三周训练数据
xAI一名员工在数据迁移时误删了2到3周的核心训练数据,这或为Grok重组震荡后遗症。xAI为追Claude等,采取喂Cursor数据、自研V9等策略,还曾借道访问竞品模型。如今xAI把算力租给对手变现。
头号玩家照进现实!NTU发布世界模型交互新范式,攻克主动操作难题
南洋理工大学MMLab团队推出Hand2World,让AI世界模型能真正互动。它摒弃旧有遮挡误导,用3D手部结构与射线编码解耦手与头运动,实现闭环持续交互,基于单目视频全自动标注,为AR、机器人交互铺路。
提效40%?揭秘AI驱动的支付方式“一键接入”系统
文章围绕AI驱动的支付方式“一键接入”系统展开。先指出跨境支付接入流程痛点,介绍借助Qwen Coder + MCP工具链构建提效系统的目标。接着阐述技术架构、流程,以及提升AI采纳率的方法,最后展示效果、规划未来。
老黄怒怼玩家根本不懂AI!英伟达新AI功能遭全网抵制,游戏圈炸锅了
英伟达在GTC 2026发布DLSS 5,本应是“性能革命”,却遭游戏圈抵制。它用生成式AI“注入”光影和材质,从“帮放大画面”变为“帮重绘画面”,玩家不满AI网红脸,老黄称是“GPT时刻”。
长达790年视频镜头,打造原生多模态世界模型!北京智源研究院用Emu3.5统一“世界”
北京智源研究院发布并开源基于原生多模态训练的世界学习者Emu3.5,它将视觉和语言视为同一种数据流,在超13万亿token数据上学习,解决长视野多模态信息处理问题,经多阶段训练和优化,能力强大且已开源。
卡帕西:强化学习很糟糕,但其他所有方法都更糟
卡帕西在近两小时访谈中解答诸多问题。他认为AGI成熟约需十年,现有的LLM有认知缺陷,强化学习糟糕但其他方法更差,AGI将延续2%GDP增长趋势,还谈及自动驾驶、教育等方面看法。
央企出手,让选大模型更容易了!中国移动发布MoMA聚合服务引擎
7月26日,中国移动在世界人工智能大会发布MoMA多模型与智能体聚合及服务引擎。它汇聚优质模型与智能体,为复杂任务提供方案,解决调度、意图理解、成本收益平衡等难题,还应用于灵犀智能体2.0。