「结构化语言」共找到 2155 篇相关文章
老外傻眼!明用英文提问,DeepSeek依然坚持中文思考
DeepSeek-V3.2和DeepSeek-V3.2-Speciale推理能力显著提升,海外研究者用英文提问,它却用中文思考。评论有两种观点,相关论文显示中文省token但非最有效,大模型选思考语言并非只看效率。
DeepSeek的GRPO会导致模型崩溃?看下Qwen3新范式GSPO
文章围绕大语言模型后训练阶段的强化学习算法展开。介绍了OpenAI的RLHF、DeepSeek的GRPO,重点指出Qwen团队发现GRPO有稳定性问题,会致模型崩溃,进而提出新算法GSPO,实验显示其效率和可扩展性更佳。
无需标注和奖励模型!仅靠自信度RL,16个样本训练20步,效果飙升21%!
论文提出RLSC,让大语言模型用自身答案置信度作奖励信号,摆脱人类标注依赖。它以模型自信度内部信号替代多数投票外部信号,小成本提升模型数学能力,还让模型学会快推理,不过也存在安全隐忧。
腾讯开源Cube Sandbox:60毫秒冷启动的AI沙盒运行时
Harness设计中沙箱是重点难点,传统方案在安全与性能间妥协。腾讯开源Cube Sandbox,用RustVMM重构虚拟化层,冷启动60毫秒,单实例5MB内存开销,有真内核隔离等优势,开源版本含网络隔离组件。
vivo发布端侧多模态模型,只有3B可理解GUI界面,20项评测表现亮眼
vivo AI Lab发布端侧多模态模型BlueLM - 2.5 - 3B,融合文本与图文能力,支持长短思考模式切换。它在20余项评测中表现出色,参数量小,训练和推理成本低,有精巧结构、高效策略,还有高质量数据和高性能平台支撑。
Vibe Coding 在代码生成与协作中的实践与思考
本文整理自阿里专家向邦宇的分享。探讨构建 Vibe Coding 工具,介绍其分类、在阿里现状。指出用户使用中面临代码质量等问题,产品自身有设计、安全挑战。还分享 Agent 建设经验,强调适配国产模型及模板化的作用。
万亿级思考模型,蚂蚁首次开源!20万亿token搅局开源AI
10月14日蚂蚁集团发布万亿参数思考模型Ring-1T,在多领域表现出色,推理能力直逼闭源巨头。此前已开源旗舰通用大模型Ling-1T。还介绍了训练技术创新,虽模型有不足,但开源夺冠证明‘思考力’可工程化。
大模型如何赋能 Web 渗透测试?
文章指出传统Web安全检测有局限,而大语言模型(LLM)可提升漏洞发现覆盖率与准确性。以mcp server为基础介绍自动化漏洞检测方案,还分享实践操作、遇到的问题及解决办法,分析其优缺点并给出拓展思路。
李飞飞World Labs最新判断:AI写完代码,下一步是「写世界」?
这篇来自 World Labs 的博客探讨了 AI 参与空间创作和现实世界任务时的通用接口,认为是 3D 。它像代码一样可结构化表达,还分析了神经图形学、模拟引擎的作用,并介绍了相关项目。
挺意外的,Agent长期记忆潜力被AMemGym挖出来了
论文提出交互式在线策略评测框架AMemGym,它能反映AI助手长期记忆能力、驱动Agent自我进化记忆。它以结构化状态演化为骨架支撑自由对话评测,还对主流记忆系统做了扫描,带来评估与训练范式转换。