「动态语言」共找到 1438 篇相关文章
Thinking Machines 发布 Tinker API,实现灵活的模型微调
Thinking Machines公司发布Tinker API用于开放权重语言模型微调,可减少开发者基础设施开销。支持多种模型架构,集成LoRA,还发布开源存储库。虽有竞品,但Tinker侧重暴露低级原语,尚处封闭测试。
直播预约 | LightMem:面向大模型的轻量化可插拔记忆系统
本报告聚焦大语言模型长期记忆构建与轻量化机制。现有外部记忆系统有记忆臃肿、组织低效、更新代价高问题。为此提出LightMem架构,能为大模型提供轻量、高效、可扩展记忆组件。
刚刚,这家0产品0模型就估值854亿的公司,终于发布了首款产品!
Thinking Machines Lab推出首款产品「Tinker」,这是专为语言模型微调而生的API,让开发者摆脱底层架构束缚,用简单Python代码专注创新。它功能强大,目前免费私测,已获普林斯顿、斯坦福等团队使用。
国产开源大模型:再见9月,你好10月~
9月国产大模型持续开源,涉及DeepSeek、Qwen、百度等。如DeepSeek-V3.1缓解语言问题、优化Agent能力;阿里Qwen系列开源超10个模型;百度Qianfan-VL增强领域能力等。还展望10月新模型开源。
首款推理具身模型,谷歌DeepMind造!自主理解/规划/执行复杂任务,打破一机一训,还能互相0样本迁移技能
谷歌DeepMind发布新一代通用机器人基座模型Gemini Robotics 1.5系列,由GR 1.5和GR - ER 1.5组成,结合视觉、语言与动作,实现“规划 + 执行”闭环,还提出Motion Transfer机制,能跨机器人迁移技能。
给几何图片写标题就能让AI更聪明,UIUC发布高质量可泛化几何数据集
随着多模态大语言模型在视觉问答等任务广泛应用,其几何推理能力成研究热点。现有方法泛化能力有限,UIUC团队提出Geo - Image - Textualization框架,发布GeoReasoning - 10K数据集,提升模型几何推理表现。
AI视频生成走向「演技生成」时代,生数科技Vidu全球发布Vidu Q2
9月25日,生数科技全球上线新一代图生视频大模型Vidu Q2,打破AI生成表情假、动作飘忽等问题,实现从“视频生成”到“演技生成”跨越,有AI演技生动、镜头语言丰富等亮点,已多端上线。
CrowdStrike联手Meta发布AI安全基准,让AI在真实网络攻击中证明自己
美国网络安全巨头CrowdStrike与Meta在Fal.Con 2025大会联合推出开源基准测试套件CyberSOCEval,旨在评估AI大语言模型在真实SOC环境下的网络安全能力,它源于Meta之前框架,开源供全球开发者使用。
美团开源新模型,多项能力实测第一
美团发布5600亿参数的LongCat - Flash模型,有创新动态计算机制和高效训练推理架构。它在多项测评中领先,尤其在代理工具使用测试表现出色,还以宽松许可开源,降低使用门槛。
Meta提出Deep Think with Confidence:几乎啥都不用动,就能提升推理的准确性与效率
传统自一致性方法虽能提升推理准确率,但计算开销大、收益递减。Meta AI与UCSD团队提出Deep Think with Confidence(DeepConf),可在不增训练成本和不调超参数下,提升推理准确性与效率,本文对其全面解读。