视觉 - 语言 - 动作模型」共找到 1811 篇相关文章

算法论文7

递归神经网络的复兴:Mixture-of-Recursions

Google DeepMind研究者设计的语言模型,能判断关键单词并进行深度递归计算,通过轻量级“路由器”节省计算资源,在同等训练成本下表现显著优于传统模型,文中还提及其他解决动态算力分配问题的思路。

PaperAgent
开源动态8

Suno最强开源对手来了!ACE Studio和阶跃星辰联合开源了一款音乐模型,20秒即可生成4分钟神曲!

ACE Studio和阶跃星辰联合开源音乐模型ACE - Step,参数量3.5B,结合多种技术,支持多语言多风格音乐生成。20秒可生成4分钟歌曲,比传统模型快15倍,有多种功能亮点,还介绍了上手步骤和应用场景。

开源星探
新闻资讯7

烧Token成KPI,8.5万Meta员工狂刷60万亿Token,争榜一大哥

硅谷兴起“tokenmaxxing”,将token使用量作为生产力基准和竞争指标。Meta超8.5万员工参与烧token竞赛,30天消耗超60万亿。国内阿里、腾讯也有相关动作,科技大佬推波助澜,Anthropic年化收入破300亿美元。

机器之心
新闻资讯7

独家 | 开普勒联合创始人胡德波成立「索塔无界」,聚焦通用基座模型+海外市场

AI科技评论独家消息,开普勒机器人联合创始人胡德波2026年4月成立索塔无界。该公司聚焦通用基座模型,以统一潜空间世界动作模型为核心,提出物理智能大脑技术路线,已与欧美企业达成合作意向。

AI科技评论
算法论文8

刚刚,Anthropic这篇论文上了Natrue

Anthropic关于“潜意识学习”的研究发表于《Nature》杂志。研究揭示大语言模型能通过与语义无关的数据传递行为特征,如偏好、不对齐行为等,还探究了其机制,并在MNIST上验证。

PaperAgent
算法论文8

刷榜自动驾驶语义场景补全!北大新作:高维度、高密度 | AAAI'26

北京大学彭宇新教授团队提出视觉语义场景补全方法HD² - SSC,通过高维度语义解耦和高密度占用优化,解决现有技术维度与密度差异问题,在两自动驾驶数据集上取得最优性能。

新智元
产品应用7

本地运行OpenAI Whisper语音识别模型,Unity3d环境下高性能离线转写解决方案

这是为whisper.cpp提供的Unity3D绑定库,能在本地设备高性能运行OpenAI Whisper自动语音识别模型推理。支持多语言识别与翻译,有不同大小模型,可本地运行,还介绍了使用方法。

GitHubStore
算法论文8

仅用1/9的token拿下SOTA,用LLM当知识路由:全新RAG框架DeepSieve

语言模型遇「最新」或「垂直领域」知识易出错,传统RAG做法有痛点。全新RAG框架DeepSieve把LLM当知识路由器,四步筛选信息,实验精度高、成本低,消融实验明确各模块价值,还有救场案例。

PaperAgent
开源动态7

《Loop Engineering橙皮书》发布!免费,开源

《Loop Engineering橙皮书》发布,免费开源。Loop Engineering概念由多人共同推动,它是在提示词、上下文、缰绳工程基础上更进一步。文中介绍了循环的动作、零件,Claude Code的相关命令,也指出新手实践的坑。

花叔
开源动态7

在一台1970年代的PDP-11上训练Transformer需要多久?答案是5.5分钟

近日,开发者复现1970年代技术环境,用PDP - 11汇编语言实现Transformer并训练成功,项目叫ATTN - 11。在低资源下实现功能闭环引热议,大家思考Transformer到底需要什么。

机器之心