「跨语言推理」共找到 3111 篇相关文章
谷歌开源Gemma 3n:2G内存就能跑,100亿参数内最强多模态模型
本周五凌晨,谷歌正式发布、开源全新端侧多模态大模型 Gemma 3n。它有多模态设计、专为设备端优化等特性,核心是 MatFormer 架构,还采用了 PLE 技术等,在多方面实现质量提升。
AI 当导演编剧和剪辑?FilMaster打开自动化电影创作新纪元
当前多数AI电影生成系统难达‘专业级’,香港大学推出FilMaster系统。它融合摄影语言与后期制作流程,分两阶段创作电影,能生成高质量作品,但高级后期制作技术未纳入。
LLM进入「拖拽时代」!只靠Prompt,几秒定制一个大模型,效率飙升12000倍
新智元报道,NUS、UT Austin等机构研究人员提出「拖拽式大语言模型」(DnD),它基于提示词生成模型参数,无需微调适应任务,效率最高提升12000倍,零样本泛化能力出色。
CVPR 2025 Tutorial:从视频生成到世界模型 | MMLab@NTU团队&快手可灵等联合呈现
图像生成普及,视频生成也有高质量发展,可灵、Sora等模型不断拓宽边界。CVPR 2025 Tutorial将探讨视频生成能否成世界模型桥梁、具身智能核心能力等问题,汇聚一线研究者分享。
DeepSeek 新模型 R1-0528 悄悄开源,与o3 相当,实测来了。
DeepSeek团队悄无声息地在Hugging Face上开源推理模型新升级版DeepSeek R1-0528,基于DeepSeek-V3-0324模型,架构和训练方法有改进,性能与o3相当,实测表现不错。
准确率92.7%逼近Claude 3.5、成本降低86%,开源代码定位新神器LocAgent来了
OpenHands 等团队发布 LocAgent,这是用于代码定位的图索引 LLM Agent 框架,准确率达 92.7%。它把代码库解析成图,提供工具接口,经实验效果出色,开源微调模型降本增效,还能提升问题解决率。
豆包可以跟你打视频了,陪我看《甄嬛传》还挺懂!难倒一众AI的“看时钟”也没难倒它
国产AI豆包发布视频通话新功能,能实时报准时钟时间,还接入联网搜索,准确性和时效性强。实测中,它可当看剧搭子,还能识别食材、解答物理题等,背后是豆包·视觉理解模型在发力。
狂揽22.6k星!这个开源工具让你一键调用100+大模型,开发效率直接起飞!
LiteLLM是BerriAI团队开发的开源工具,通过标准化OpenAI格式API接口,能无缝调用100+主流大语言模型。有核心功能亮点,适用于多场景,还给出上手步骤,并与同类项目对比。
万字详解GPT-6 Astra,Sebastian Raschka带你读懂循环Transformer与隐藏的思维链
著名技术博主Sebastian Raschka针对GPT-6 Astra的循环Transformer设计与隐藏思维链争议,万字详解技术细节,分享Astra实测表现,梳理循环Transformer技术演进,澄清相关误解。
聚焦物理智能最前沿,PAIR首届年度会议即将开启!
当大模型能理解语言与图像,‘物理智能’指向智能从比特到原子的跨越。2026 年 9 月 20 - 21 日,上海物理智能与机器人研究院将主办‘PAIR Conference 2026’,设主题学术和商业闭门会议。