端到端框架」共找到 3693 篇相关文章

开源动态8

语音“PS”来了!蚂蚁又放大招,ASR+TTS+编辑的全能语音模型开源了!

在大模型浪潮下,语音领域迎来“整合与统一”趋势。阿里蚂蚁团队推出统一语音模型Ming - UniAudio,能在一个框架下完成识别、生成、编辑等任务,语音编辑能力创新,开发者上手简单。

开源星探
算法论文8

大模型赋能的具身智能:自主决策和具身学习技术最新综述

具身智能是通往通用人工智能的关键路径,但传统方法有泛化瓶颈。电子科大最新综述梳理大模型赋能具身智能的自主决策与具身学习,还将‘World Model’纳入统一框架,为研究者提供路线图。

PaperAgent
算法论文8

Tool-Star:赋予大模型结合多工具推理的能力

文章提出Tool - Star框架,旨在解决大模型多工具协作推理难题。它从数据训练流程优化,让模型调用多种工具,在复杂计算和知识型推理任务表现卓越,还探讨了未来多模态及多工具扩展方向。

PaperAgent
开源动态8

一个能思考、会记忆的AI导演诞生了!新加坡管理大学,香港中文大学等实现故事化视频生成

新加坡管理大学等提出开源全能多智能体框架UniVA,可统一视频理解、分割等能力,按指令生成完整故事视频。还引入UniVA - Bench基准测试套件,实验显示其在多任务中表现出色,代表视频智能生成重要进步。

AIGC开放社区
新闻资讯8

马斯克「世界模拟器」首曝,1天蒸馏人类500年驾驶经验!擎天柱同脑进化

特斯拉官宣「世界模拟器」,可模拟、合成自动驾驶的「孪生世界」,生成不同视角和长尾场景。它基于神经网络,有学习人类价值观等优势。还能用海量数据解决难题,输出可解释中间结果,为自动驾驶和擎天柱训练服务。

新智元
推荐文章7

入局AI Infra:程序员必须了解的AI系统设计与挑战知识

文章分享传统后台工程师技术栈和方法论如何迁移AI系统,系统性拆解AI Infra的硬件、软件、训练和推理挑战,如硬件从CPUGPU、软件依赖深度学习框架,还分析训练和推理面临的问题及解决办法。

腾讯技术工程
产品应用8

kimi 的RL end2end ON LLM

文章分享Kimi Researcher背后技术思考,采用强化学习打造大模型Agent。对比传统方法,凸显其灵活通用、能力上限高、可扩展优势。还展示其在考试榜单成绩提升及智能“涌现”,介绍多应用场景。

Agent的潜意识
产品应用7

打破 AI 辅助开发碎片化困境,阿里巴巴 R2C Agent 的 AI 编程实践

文章围绕阿里巴巴 R2C Agent 的 AI 编程实践展开。指出当前 AI 辅助开发存在与生产链路结合难、协作碎片化等问题,介绍了 R2C Agent 如何驱动研发链路,阐述其框架、实施情况及未来提升 AI 渗透率的目标。

InfoQ
产品应用8

OneSearch,揭开快手电商搜索「一步位」的秘技

本文介绍快手提出的电商搜索生成式框架 OneSearch。它有三大创新,包括 KHQE 模块、用户行为序列注入策略、偏好感知奖励系统。实验显示它在多方面提升显著,已部署于快手电商搜索场景。

机器之心
开源动态8

MiniCPM-o 4.5 技术报告发布:全双工全模态 API 开放,RTX5070即可实时运行

面壁智能联合多机构发布 MiniCPM-o 4.5 技术报告,公开 Omni-Flow 框架。该模型 9B 参数实现全双工全模态,开放在线 Demo、API 等,最低 12GB 显存 GPU 可运行,在多维度评测表现出色。

AI科技评论