多语言推理」共找到 6081 篇相关文章

算法论文8

模仿学习新范式!Chain-of-Action:轨迹自回归实现动作推理

具身智能领域尚未迎来「GPT时刻」,现有模仿学习范式有缺陷。字节跳动与阿德莱德大学研究者提出「动作链」(CoA)策略,通过轨迹自回归建模解决累计误差,提升泛化性,实验效果显著。

机器之心
算法论文8

Transformer可以改装成Mamba了:苹果把推理成本直接打成线性

苹果将Transformer改造成Mamba,采用‘两步走’策略,先造中间形态,再转成Mamba,避免性能崩塌。实验显示,新方法性能几乎没掉,成本逻辑改变,为模型降本重构提供新可能。

机器之心
推荐文章7

《动手写AI Agent》模型适配:一套代码跑通三家 LLM

上一章用火山引擎豆包 API 写了能跑的 Agent,但换模型重写代码会混乱。本章用 Adapter 模式解决问题,介绍火山引擎、Claude、OpenAI 三家 API 关键差异,还分析了 Claude 工具调用格式特殊之处。

AI Reading Hub
开源动态7

FACTS 基准测试套件问世,用于评估大型语言模型的事实准确性

FACTS 基准测试套件由 FACTS 团队与 Kaggle 联合开发,基于原 FACTS Grounding Benchmark 增加三个新基准,可从四个维度评估大模型事实性。初步结果显示进展与挑战并存,模态成难题。

InfoQ
产品应用8

Claude Code 2.1 发布:一口气更新了80个功能特性

2026年1月7日Claude Code发布2.1.0版本,后又跟了2.1.1小修复,更新内容超80条。有Skills自动热重载等新功能、大量bug修复及体验优化。作者建议大家升级,认为它想做完整开发环境。

花叔
算法论文8

AAAI 2026 Oral|LENS:基于统一强化推理的分割大模型

文本提示图像分割技术有战略意义,但基于监督式微调的方法有泛化能力瓶颈。为此引入LENS框架,采用强化学习机制,还介绍其架构、奖励机制,该框架在测试中表现优异,代码已开源。

机器之心
7

在 Sora 诞生之前,胡修涵做了两年的「二次元版 Sora」

Sora发布后迅速获数百万用户,全球刷屏。国内创业公司捏Ta在其诞生前两年就开始做类似产品,专注二次元和OC人群。捏Ta创始人胡修涵分享对Sora的看法,认为它是新形态产品,还在探索需求。同时谈及捏Ta发展阶段、特色功能及社区运营理念等。

Founder Park
产品应用7

Ollama升级模型调度系统:内存管理更精准,GPU性能提升

Ollama升级模型调度系统,精确测量运行模型所需内存,带来内存崩溃减少、GPU利用率提高等改进。Gemma3、Mistral - small3.2等模型性能提升,更模型正迁移,还在开发iGPU支持,评估NPU支持。

AI工程化
产品应用7

用最简单的大模型技术打造一个迁云专家有难?

文章探讨在云迁移领域用大模型技术“复制”专家80%核心能力。分析标准化方案不足及简单RAG局限,介绍“LX0.1”AI专家助手构建,还提及分层评测、人机协同等优化,最后展望AI在云迁移的未来方向。

阿里云开发者
7

爆款AI视频越来越,但本质我觉得跟炒股没区别。

作者以AI视频爆款频出为背景,借唐朝张大麻、自身炒股经历等故事,探讨AI视频爆款复制价值、获流量人数及流量后续价值,指出创作应重持续经营,勿盲目跟风。

数字生命卡兹克