全场景」共找到 3476 篇相关文章

算法论文8

「听觉」引导「视觉」,OmniAgent开启模态主动感知新范式

针对端到端模态大模型痛点,浙江大学、西湖大学、蚂蚁集团联合提出 OmniAgent,它基于「音频引导」,用「思考 - 行动 - 观察 - 反思」闭环实现范式转变,在多基准测试中超越开闭源模型。

机器之心
新闻资讯8

华为算力“公共事业”:“超节点+栈开源”如何撬动AI未来?

文章围绕华为算力“公共事业”展开,介绍其“超节点 + 栈开源”模式。华为通过推出系列算力芯片、构建“超节点 + 集群”方案、面开源开放软硬件等举措,满足球产业算力需求,推动AI产业变革。

InfoQ
新闻资讯7

Le Chat方面对标ChatGPT,欧洲AI新贵穷追不舍

欧洲AI初创公司Mistral AI接连发布多个开源模型,还升级Le Chat,引入深度研究、语音等新功能,方面对标ChatGPT。其语音识别模型Voxtral号称“球最佳”,多方面超越竞品。

机器之心
推荐文章7

AI研发新范式:基于技术方案链路生成代码

文章指出过往代码补方式存在局限,腾讯广告审核团队探索新AI开发范式。介绍业界AWS、Lovable范式,阐述审核团队实践范式,含定义、技术选型、过程标准化等,还提及进展、困难与未来展望。

腾讯技术工程
新闻资讯7

Anthropic发布多Agent协作模式指南:5种架构与适用场景

当单个AI Agent无法完成任务时,多Agent系统就派上了用场。Anthropic最新发布的指南给出了五种经过验证的模式,包括生成 - 验证模式、编排 - 子代理模式等,并介绍了适用场景和陷阱。

AI工程化
开源动态7

【7.2K Star】Google 基于LangGraph打造栈Deep Research

谷歌开源Deep Research栈应用,前端用React(with Vite)和Shadcn UI,后端研究代理用LangGraph,需Redis和Postgres数据库,LLM用Google Gemini,网络搜索用Google Search API,还介绍了Agent执行流程。

CourseAI
算法论文7

SceneGen: 单图像驱动的多资产3D 场景生成

上海交通大学提出SceneGen框架,可从单张场景图像及其对应目标掩码中,同时生成带有几何结构与纹理的多个3D资产。它一次前向传播即可完成生成,在效率与稳健性上优于现有方法,虽有局限但应用潜力大。

带你学AI
新闻资讯7

人在美国,待过三家AI Lab,凉了!

科技行业大裁员,Meta裁掉老将田渊栋,AI从业者人心惶惶。南洋理工大学副教授Boyang Li工作过的三家工业研究实验室倒闭,他分享经历,探讨工业研究困难的原因。

新智元
算法论文7

谈一谈TP推理场景下MoE Group GEMM的优化思路

作者在使用H20测试SGLang CUTLASS MoE时,发现其在中小Batch Size场景下性能不佳。为此设计Expert Specialization方案,启动多个不同配置Kernel,依Expert计算特性选合适的。还介绍了该方案在H20和Hx00上的实现细节及性能测试结果。

GiantPandaLLM
开源动态8

单目3DGS迎来突破:影石开源UniSHARP实现相机适配

影石研究院发布单目新视角合成模型UniSHARP,可通过单次推理秒级获场景高斯点云,支持混合相机训练与免标定推理,适配所有相机。团队还构建数据集、设benchmark,代码等均已开源。

机器之心