核心能力」共找到 4549 篇相关文章

开源动态8

视频生成Prompt何须仅是文字!字节&港中文发布Video-As-Prompt

AI视频生成中,依赖抽象语义控制的创作因缺乏统一条件表征而困难。字节与港中文团队提出Video - As - Prompt框架,引入‘视频参考’范式,实现抽象语义下可控视频生成范式统一,代码和数据集已开源。

机器之心
新闻资讯7

HF Papers 直播 AI Insight Talk| Omni全模态专场

由多平台联合发起的【AI Insight Talk】系列直播活动第五场 - Omni全模态大模型专场于2025年11月18日10:00 - 12:00直播。多位全模态模型核心研发者将分享技术,还有圆桌对谈。

Hugging Face
开源动态8

从VLA到RoboOmni,全模态具身新范式让机器人察言观色、听懂话外音

复旦大学等联合推出全模态端到端操作大模型RoboOmni,统一多模态,实现动作与语音协同控制。它重新定义机器人交互范式,让机器人具备“察言观色”能力,还构建了OmniAction数据集,实验表现全面领先。

机器之心
开源动态8

Meta开源史上最强语音“基座模型”:一口气支持1600+种语言

Meta AI FAIR团队发布Omnilingual ASR模型套件,能为超1600种语言提供自动语音识别能力。它引入新架构提升性能,改变引入新语言范式,还发布相关数据集和模型,与全球伙伴合作。

AI寒武纪
新闻资讯7

PyTorch 基金会迎来 Ray 项目,并推出 Monarch 简化分布式 AI 开发

2025 年 PyTorch 大会上,PyTorch 基金会宣布 Ray 项目加入,还推出 PyTorch Monarch 简化分布式 AI 工作负载。大会突显基础模型开发对透明度和可复现性的推动,基金会欲成开放式 AI 基础设施核心枢纽。

InfoQ
新闻资讯7

我为马斯克扮演机器人!擎天柱背后竟是最贵「演员团」

外媒揭秘特斯拉擎天柱靠人工数据训练。在实验室,员工重复日常动作,由摄像机记录。工作体力消耗大,要求严格,团队曾超百人,还裁掉部分人员。虽马斯克看好,但实际仍在靠人力蹒跚学步。

新智元
开源动态7

Meta 发布 Docusaurus 3.9,新增 AI 搜索功能

近日 Meta 发布 Docusaurus 3.9,重点更新有现代化运行时环境、增强 AI 搜索能力、提升国际化灵活性。如支持 DocSearch v4 让用户对话查内容,提高 Node.js 最低要求,改进 i18n 配置等。

InfoQ
推荐文章7

破立之间:智驾芯片博弈的“新赛道”

全球汽车产业向智能化转型,智驾芯片成产业链核心。当前产业面临多重困境,国际巨头垄断高端市场,行业陷入“算力堆砌”。SDSoW技术是破局之道,有三大特征,能实现性能、能效等多方面提升。

芯师爷
产品应用7

跟这个音乐Agent聊会儿,分分钟生成抖音神曲 | 对话音乐创作Agent产品Tunee

量子位智库对话国内首个音乐创作Agent产品Tunee负责人贾朔,探讨了产品适配用户群体、核心交互形式、解决需求模糊性等问题,还提及产品价值、迭代方向及推出智能硬件的原因。

量子位
推荐文章7

8 个月做到 1 亿美元 ARR,Lovable 增长负责人:免费用户不是成本,是营销渠道

Lovable增长负责人Elena Verna分享产品增长经验,指出增长团队核心是解决分发问题,PLG概念被过度炒作,传统增长策略失效,应把免费产品当营销预算,还给出未来增长的8个关键策略。

Founder Park