「语言世界模型」共找到 8247 篇相关文章
GPT-5.4 仅 11.36%!当大规模工具生态变成迷宫,LLM Agent 还能完成长程规划吗?
PlanBench-XL 来自 UIUC 团队,将 LLM Agent 放入零售 API 世界,评测其长程规划能力。它考虑真实工具环境挑战,含 327 个任务等,发现多数模型规划难、恢复差等问题,并给出改进启示。
比Sora更疯狂!英伟达AI让机器人「做梦」修炼,无师自通直接上岗
英伟达新研究项目DreamGen用视频生成模型让机器人在神经网络生成的「梦境世界」自主探索学习。它能让机器人掌握新动作、泛化到新环境,合成数据暴涨333倍,还引入DreamGen Bench用于视频生成基准。
Self-evolving Agents过程并非总是良性的,要警惕这些“错误进化”风险
近年来,基于大语言模型的智能代理成为热点,自进化代理可自我改进。但论文指出其进化可能“跑偏”,出现“错误进化”,并揭示了不同进化路径的风险,还提出缓解策略,呼吁重视其安全性。
RoboScience机器科学发布轮式仿人形机器人REX G1,打造新一代具身生产力伙伴
8月17日,RoboScience机器科学发布轮式仿人形通用操作机器人REX G1。它搭载自研VLOA架构通用具身大模型Visics,面向多场景,能在真实世界完成任务闭环,具备多方面优势。
面壁小钢炮 VoxCPM-TTS:开源端到端 TTS,轻量高效低延迟
面壁提出基于扩散自回归建模的端到端语音生成模型 VoxCPM,构建于 MiniCPM - 4 之上。它克服传统离散 token 方法缺陷,实现语义与声学特征解耦,有上下文感知语音生成和零样本语音克隆能力,低延迟。
5.6K Star!原本付费现在开源!本地版“ElevenLabs”,视频翻译+声音克隆全免费!
今天给大家安利GitHub上开源神器Voice - Pro,它原本是商业付费软件,因团队无暇管理而开源。整合多个先进语音模型,将视频处理流程打包成本地软件,免费且功能强大。
真正能离线跑的完全开源翻译工具
Argos Translate是用Python写的开源离线翻译引擎,底层靠OpenNMT,推理用CTranslate2。可当库、命令行、桌面软件用,模型是本地zip包,不联网也能用。支持主流及小众语言,有多种使用方式。
手机跑多模态也能快到飞起!面壁MiniCPM-V 4.6开源
面壁智能开源多模态模型MiniCPM-V 4.6,以低算力成本、超低首Token延迟打通三大主流手机操作系统。它算力瘦身性能强,是视觉语言多面手,还适配主流系统,降本增效,让AI能力从云端到指尖。
Qwen3.6-Max-Preview来了!
继Qwen3.6 - Plus发布,推出Qwen3.6 - Max - Preview预览版,相比前者有更强世界知识、指令遵循能力,智能体编程表现显著提升。可在Qwen Studio交互,也将通过阿里云百炼API调用。
【开源】build-your-own-x:30+领域造轮子教程,程序员内功提升指南
开源项目 build-your-own-x 收录 30+ 领域「从零造轮子」教程,解决学编程只知用不知原理的问题。涵盖 3D 渲染、AI 模型等多领域,多语言可选。介绍学习好处、使用方法,还推荐优质教程。