跨语言能力」共找到 4184 篇相关文章

算法论文8

答对了却没看图?EASE给多模态RLVR装上「视线校正器」

强化学习与可验证奖励提升视觉语言模型推理能力,但存在答案奖励只知对错、不知证据区域问题。哈工大等团队提出EASE,把标注证据区转为目标分布,监督空间注意力,推理无额外标注,实验成绩优异。

机器之心
产品应用8

首款推理具身模型,谷歌DeepMind造!自主理解/规划/执行复杂任务,打破一机一训,还能互相0样本迁移技能

谷歌DeepMind发布新一代通用机器人基座模型Gemini Robotics 1.5系列,由GR 1.5和GR - ER 1.5组成,结合视觉、语言与动作,实现“规划 + 执行”闭环,还提出Motion Transfer机制,能机器人迁移技能。

量子位
开源动态8

AgentScope 正式发布 Skills 支持 - 实现渐进式披露

文章指出大语言模型驱动的Agent系统存在核心矛盾,常见上下文加载方案有局限,缺乏灵活机制。介绍了AgentScope发布的Skill机制及渐进式披露策略,还讲了其在Java中的实现,最后分析了适用与不适用场景。

阿里云开发者
算法论文8

“坏”数据让模型更“好”?重新审视数据过滤

传统观点认为大型语言模型预训练应过滤“坏数据”,但论文《When Bad Data Leads to Good Models》提出反直觉观点,适度加入有毒数据,通过后训练技术可降低模型毒性,保持一般能力,挑战常规做法。

深度学习自然语言处理
新闻资讯8

Mistral 发布 OCR 3,提升了手写及结构化文档识别的准确率

Mistral 发布 OCR 3,在多种文档类型上精度更高,超越前一代产品。能提取文本、识别图像并保留文档结构,输出 Markdown 格式。早期用户认可其性能和多语言支持,生产部署扩展快,价格有优势。

InfoQ
算法论文8

可攻可防,越狱成功率近90%!六大主流模型全中招 | EMNLP'25

研究人员聚焦大型语言模型(LLMs)安全漏洞,提出全新越狱攻击范式SCP与防御策略POSD。SCP基于DTD机制,在6个主流模型上平均攻击成功率达87.23%;POSD能有效抵御攻击,还提升模型泛化能力

新智元
产品应用7

LLM加速利器LMCache,极大降低GPU资源消耗

LMCache是大语言模型服务引擎扩展组件,能降低首次响应延迟、提升吞吐量,适用于长上下文场景。它将KV缓存存于多级存储,服务实例复用任意重复文本的KV缓存,节省GPU算力,与vLLM结合优化显著。

GitHubStore
新闻资讯8

Altman 亲自坐镇发布 ChatGPT Image 2,小编实测:风格、画质、叙事感全都夯爆了

OpenAI CEO Sam Altman 亲自发布 ChatGPT Images 2.0,这是该公司迄今功能最强的图像生成模型。它有思考能力,可直出 8 张连贯图片,支持多语言、多种画幅与分辨率,能精准执行复杂指令,直接商用也没问题。

InfoQ
算法论文8

CVPR 2026 | 1000万段驾驶视频,教会模型如何估计相机位姿

Wayve的LA - Pose研究,不依赖百万级3D标注,从约1000万段未标注驾驶视频自监督学习‘潜在动作’,再用少量3D标注微调,转化为相机位姿估计能力,在多基准上提升精度且泛化能力强。

机器之心
算法论文8

ICML 2026|告别「单线程」思维,智能体进化出了原生的并行推理大脑

北京通用人工智能研究院语言交互实验室提出原生并行推理器NPR,它有「自蒸馏 + 并行强化学习」三阶段训练范式,配套并行推理引擎,让并行推理成模型原生认知能力,还介绍了其具体实现、实验结论等。

机器之心