多模态开发」共找到 2442 篇相关文章

产品应用7

等等,MiniMax H3不是刚发布吗?怎么就卷到几分钱的价格了……

MiniMax新发布的视频模型H3在多模态能力出色,霸榜Artificial Analysis榜单。但开源模型有部署和成本难题,秘塔AI上线该模型,免部署,2K方案0.15元/秒,768P方案0.09元/秒,降低创作门槛。

量子位
开源动态8

AI驱动的开源攻击框架:HexStrike-AI

HexStrike-AI是安全研究员开发的开源攻击框架,2025年7月起在GitHub免费提供。它基于MCP协议,集成LLM与150多种工具,可自动化渗透测试和漏洞发现。曾被网络犯罪分子利用,能加速攻击流程,展现强适应和并行化能力。

AI与安全
产品应用7

智能体请求暴增 9.4 倍,token 账单却没涨:Uber 公开 AI 软件工厂省钱方法

AI 工具已嵌入 Uber 软件开发各阶段,智能体请求量增长 9.4 倍,但 AI 总支出自 4 月相对稳定。文章介绍其软件工厂思考,包括智能体会话层级、成本公式、指标测算及优化手段,还提及未来举措。

InfoQ
开源动态8

中国19岁常青藤少年重塑AI记忆,斩获各大榜单全球第一,点亮AI联想科技树

M-Flow记忆引擎引发海外开发者社区热议,GitHub star破千,在三大公开benchmark评测中夺冠。它由19岁团队心流元素开发,采用Cone Graph分层结构,实现Graph RAG新范式,更注重联想,而非单纯搜索。

新智元
算法论文8

五倍推理加速,激发自回归潜能,苹果新工作让LLM预测未来

近年来自回归训练方法成语言模型主流范式,但推理阶段计算开销大。苹果研究人员开发框架,让预训练自回归大模型多 token 预测,代码和数学任务推理加速达 5.35 倍,一般任务约 2.5 倍。

机器之心
推荐文章7

AI们数不清六根手指,这事没那么简单。

作者测试发现Grok4、OpenAI o3等多模态模型都将六指图数成五指,仅Claude 4偶尔答对。研究揭示大模型看图片用记忆而非视觉,易受刻板印象影响,在工业等场景或引发严重后果。

数字生命卡兹克
开源动态8

错过它=落伍!只用一张照片+14秒,腾讯开源 HunyuanVideo-Avatar 带你玩转多角色数字人

HunyuanVideo-Avatar 是腾讯混元团队最新开放的多模态数字人生成模型。上传一张人物图片,再配上一段音频,模型即可在约 14 秒内输出分辨率最高 720p、情绪可控、动作丰富且支持多角色同屏的短视频。

小华同学ai
新闻资讯8

为什么所有企业都在谈 Agent?50+ 技术实践给出真实答案

12月19 - 20日北京举办的AICon全球人工智能开发与应用大会,聚焦AI Agent等关键方向。来自腾讯等企业的实践者将分享构建智能系统经验,大会设Keynote和12大平行技术专场,呈现AI技术全景。

PaperAgent
新闻资讯7

周末我去泡温泉按模,顺带做了黑客松评委,看到了下一个趋势

作者黄叔参加百度世界与小红书科技打造的黑客松活动,其赛道分解决实际需求和精神需求两类。10 年出生小朋友获一等奖,作品创意惊艳。活动体现开发门槛降低、开发者多样,AI 应用效果涌现。

AI产品黄叔
开源动态8

8B硬刚72B!MiniCPM-V 4.5技术报告正式出炉

行业首个具备“高刷”视频理解能力的多模态模型MiniCPM-V 4.5技术报告发布,提出三项关键技术,使模型在多任务达同级SOTA,8B参数规模超72B模型,推理快,开源后获社区好评。

量子位