「空间语言模型」共找到 8038 篇相关文章
Google 把翻译能力彻底开源了!TranslateGemma:550种语言通吃,还能直接看图翻译!
Google将多年积累的翻译能力灌进开源大模型TranslateGemma,它基于Gemma 3,专为翻译任务调优,有3个规模版本,覆盖550种语言,能直接看图翻译,亮点颇多。
2025 年中丨大模型市场分析报告
这是《2025年中丨大模型市场分析报告》。指出基础大模型塑造计算未来,企业重心转向推理。Anthropic超OpenAI成市场头号玩家,开源模型采用趋缓,企业换模型重性能,AI支出从训练转向推理。
谷歌DeepMind深夜放核弹:世界模型Genie 3登场,重新定义“生成式AI”
谷歌DeepMind推出第三代通用世界模型Genie 3,能生成多样化交互式环境,可实时导航。它较前代有诸多突破,有模拟物理特性等核心能力,能赋能具身智能体研究,但也存在行动空间有限等局限。
DeepSeek-R1发布100天后:全面复盘推理大模型复现研究及未来!
推理语言模型(RLMs)发展显著,DeepSeek - R1发布引发广泛影响且未完全开源。MiroMind等总结其复现研究,关注SFT和RLVR方向,介绍数据构建、方法设计、训练过程细节及实验关键发现。
AI地理学家诞生:麻省理工、斯坦福用多智能体框架重塑地理空间建模,刷新SOTA
麻省理工、慕尼黑工大及斯坦福AI实验室发布GeoEvolve框架,深度融合地理知识与进化算法,实现复杂地理空间模型自动发现与优化。经实验验证,其性能超越以往基准,有望在多领域发挥作用。
刚刚,Anthropic发现Claude「类意识工作台」!神秘J空间藏着没说出口的想法
Anthropic新研究发现Claude内部存在特殊“J空间”,像静默心理工作区,浮现模型思考概念,不一定在回答里。此研究受关注,还揭示其特性、发现方式及应用,改变对Claude“心智”理解。
新型开源端到端 AI 语音模型!Voila:195ms 超低延迟引领全双工对话!
Maitrix团队发布开源AI端到端语音模型Voila,以195ms超低延迟及全双工对话受关注。它功能强大,支持多语言,有多种使用方式,适用于多个场景,架构采用模块化设计。
李飞飞自曝详细创业经历:五年前因眼睛受伤,坚定要做世界模型
在a16z播客节目中,“AI教母”李飞飞讲述创业经历。五年前眼伤失立体视觉,让她意识到其对空间交互的决定性作用。她认为真正通用智能需理解物理世界,与Martin Casado一拍即合创立World Labs,加速世界模型突破。
首个全面梳理语音大模型发展脉络的权威综述,入选ACL 2025主会
香港中文大学团队语音语言模型综述论文《Recent Advances in Speech Language Models: A Survey》被 ACL 2025 主会议接收,这是该领域首个全面系统综述,指明语音 AI 未来方向,还剖析技术架构、训练策略等。
超实用提示词模板!AI科学家教你用协作提示词激发大模型潜力
文章由知名AI科学家Lance Eliot所写,指出主流大语言模型因训练机制变得‘短视’,缺乏深度协作能力。介绍协作提示词技术,能让AI成为主动引导者,并以测试展示效果,还说明了适用场景。