统一表示学习」共找到 2040 篇相关文章

产品应用7

阿里QwenLong-32B:1W+超长Token推理,知识密集型复杂文档高效推理

文章介绍阿里QwenLong - 32B在长文本推理的能力。长文本推理有训练效率低和优化不稳定问题,QWENLONG - L1通过强化学习等解决,还阐述其组件、训练步骤,并给出实战代码及相关链接。

CourseAI
新闻资讯8

Karpathy最新发文:醒醒!别把AI当人看,它没欲望也不怕死

Andrej Karpathy在推文中反驳将大模型视作「更聪明人类」的观点,指出大模型是「非生物」智能,其进化压力、学习机制、运行方式与人类不同。清楚这是全新智能,对理解大模型很重要。

新智元
算法论文8

Thinking with Video:一种全新的思考范式

在人工智能领域,‘用文本思考’和‘用图像思考’存在局限。复旦大学等团队提出‘用视频思考’范式,通过视频生成模型统一文本与视觉推理,构建VideoThinkBench基准测试Sora - 2,全面解读这一开创性工作。

深度学习自然语言处理
产品应用7

首发丨手机的『魔法挂件』,实测钉钉dingtalk A1,有用的好帮手

2025年基于大模型的AI硬件焕发生机,钉钉dingtalk A1是其中代表。它厚度仅3.8mm,使用方便,具备会议录音转写、纪要生成、通话分析等功能,还能用于学习和生活场景。

鲸选AI
算法论文8

推理与操控能力双提升!具身机器人双系统VLA模型新突破

香港中文大学等联合提出Fast - in - Slow(FiS - VLA)统一双系统VLA模型,实现快慢系统融合。在真机和仿真测试中,成功率和控制频率提升显著,泛化能力强。未来计划探索动态调参机制。

量子位
产品应用7

SkyReels-Audio让嘴型和音频完美匹配不再难

音频驱动的动态人脸生成研究较少,昆仑万维提出SkyReels - Audio框架,基于预训练视频扩散变换器构建,支持无限长度视频生成与编辑,采用混合课程学习等策略,保障视频视觉保真度和时间一致性。

带你学AI
开源动态8

具身智能“高考”难疯了!人类100分,最强模型12.8

原推出RoboTwin系列基准的团队带来RoboDojo,这是统一的仿真+真实世界机器人操作评测基准。它设42个仿真任务、18个真实任务,让30个主流策略竞技,结果显示机器人距通用操作差距大。

量子位
新闻资讯8

产业级 Agent 如何破局?百度吴健民:通用模型难“通吃”,垂直场景才是出路

InfoQ 采访百度吴健民探讨产业级 Agent 破局点。他指出 Agentic 模型训练卡点在真实环境复刻;通用模型难“通吃”,垂直场景定制模型是关键;多模态未实现统一建模,分开优化效果更好。

AI前线
开源动态8

GitHub 爆火,这才是 Vibe Coding 的正确打开方式!

现在AI编程火,但很多人零基础不知咋上手。Github上的`easy-vibe`项目把「AI编程」从入门到实战讲透,教从想法到产品,有零基础出活、分层学习等亮点,覆盖开发完整链路。

开源先锋
产品应用7

Current Robotics 发布 Curr-0:以 Single Policy 实现全身灵巧操作

Current Robotics发布Curr - 0,解决人形机器人移动与操作分离困境。它用Single Policy统一训练,基于HumanEx采集数据,还构建多物理模态交互世界模型,是全栈具身智能基础设施成果。

AI科技评论