低资源语言」共找到 2343 篇相关文章

算法论文7

DeepSeek的GRPO会导致模型崩溃?看下Qwen3新范式GSPO

文章围绕大语言模型后训练阶段的强化学习算法展开。介绍了OpenAI的RLHF、DeepSeek的GRPO,重点指出Qwen团队发现GRPO有稳定性问题,会致模型崩溃,进而提出新算法GSPO,实验显示其效率和可扩展性更佳。

机器之心
算法论文8

无需标注和奖励模型!仅靠自信度RL,16个样本训练20步,效果飙升21%!

论文提出RLSC,让大语言模型用自身答案置信度作奖励信号,摆脱人类标注依赖。它以模型自信度内部信号替代多数投票外部信号,小成本提升模型数学能力,还让模型学会快推理,不过也存在安全隐忧。

深度学习自然语言处理
推荐文章8

WRC 2026 深度复盘:具身智能的「卡脖子」难题,终于有解了

本文复盘WRC 2026,指出具身智能面临数据焦虑,数采方与模型方割裂,数据采集成本高、效率、质量差。自变量推出QUANXTA Zero系列无本体数采方案,从模型需求反向定义数采硬件,形成数据闭环,还具备底层技术支撑。

AI科技评论
产品应用8

WAIC现场最“聪明”展台!AI眼睛耳朵能力全打开了

WAIC现场,声网展台被观众挤爆,其新奇“AI玩具”都能与玩家流畅对话。声网对话式AI引擎全新升级,新增选择性注意力锁定、视觉理解能力,能与主流数字人方案集成,还可接入大模型,价格。它已在多领域落地。

量子位
推荐文章7

AI终点不是算法,而是业务成果 | 云徙科技@MEET2026

大模型时代,基础模型参数规模不断增大,但企业核心业务中AI真实渗透率。云徙科技执行总裁毛健认为,AI终点是业务成果,应是‘运营×AI’,还指出AI跃迁为业务主体面临四重鸿沟,云徙科技提出破局方法并分享落地案例。

量子位
产品应用8

vivo发布端侧多模态模型,只有3B可理解GUI界面,20项评测表现亮眼

vivo AI Lab发布端侧多模态模型BlueLM - 2.5 - 3B,融合文本与图文能力,支持长短思考模式切换。它在20余项评测中表现出色,参数量小,训练和推理成本,有精巧结构、高效策略,还有高质量数据和高性能平台支撑。

量子位
开源动态8

腾讯混元开源 4 个小尺寸模型,主打 Agent 和长文

8月4日,腾讯混元开源四款小尺寸模型,参数为0.5B、1.8B、4B、7B,消费级显卡可运行,适用于功耗场景。模型具备推理快、性价比高特点,亮点是Agent和长文能力,已在腾讯多业务应用。

InfoQ
新闻资讯7

百芯竞逐,芯片产业的“新战国时代”

ASIC发展超预期,成AI竞争胜负手。它适配大厂专属需求,成本与功耗,出货量和市场规模将扩容。英伟达GPU虽难替代,但份额会被ASIC蚕食,谷歌TPU已撕开其垄断裂缝,大厂纷纷自研ASIC。

芯师爷
7

大模型如何赋能 Web 渗透测试?

文章指出传统Web安全检测有局限,而大语言模型(LLM)可提升漏洞发现覆盖率与准确性。以mcp server为基础介绍自动化漏洞检测方案,还分享实践操作、遇到的问题及解决办法,分析其优缺点并给出拓展思路。

阿里云开发者
新闻资讯8

人跑光了,AI视频炸了!马斯克狂发推:Grok Imagine三金封神

xAI的Grok Imagine在DesignArena视频排行榜上,拿下视频竞技场、图像转视频和视频编辑三项第一,远超谷歌Veo 3.1、Sora等对手。它进步迅猛,靠聪明设计取胜,还将推动AI从“蛮力计算”向“智能理解”转变。

新智元