「系统级工程能力」共找到 4984 篇相关文章
阿里云CIO首次系统复盘:大模型落地的 RIDE 方法论与 RaaS 实践突破
阿里云智能集团 CIO 蒋林泉分享大模型落地实践,指出企业中业务与 IT 对 AI 认知矛盾突出。他展示阿里云数字人落地成果,提出 RIDE 方法论,还剖析翻译和 Agent 两种应用模式及落地要点。
阿里云CIO首次系统复盘:大模型落地的RIDE方法论与RaaS实践突破
阿里云智能集团 CIO 蒋林泉分享大模型落地实践,介绍了阿里云在翻译、智能外呼等场景的应用案例,提出 RIDE 方法论,包括重组组织、识别机会、定义指标和推进执行,还分析了翻译和 Agent 模式的要点。
混合数学编程逻辑数据,一次性提升AI多领域强化学习能力 | 上海AI Lab
上海AI Lab的OpenDataLab团队通过大规模实验剖析RLVR在多领域推理机制。构建多领域评估框架与定制奖励策略,基于Qwen2.5 - 7B系列模型联合训练,有多项关键发现,为构建AI推理模型提供参考。
Kimi K2 详测|超强代码和Agent 能力!内附Claude Code邪修教程
作者熬夜带来 Kimi K2 模型详测及 CC+K2 邪修教程。K2 是 1T 参数量的 MoE 开源模型,基准测试成绩优异,在代码、Agent、数学推理任务表现突出,前端能力强,还能驱动 Claude Code,成本低。
LLM已能自我更新权重,自适应、知识整合能力大幅提升,AI醒了?
近期,AI自我演进话题研究讨论渐热。OpenAI奥特曼畅想AI自我改进未来,有爆料称其内部运行递归式自我改进AI。MIT论文提出SEAL框架让LLM自我更新权重,引发热议,实验显示其有提升但也有局限。
80%到25%逆转!大模型代码能力最新排名:Anthropic不再是唯一的神?
OpenRouter网站有模型使用排行榜,按不同使用场景分类。2024年12月到2025年2月,Anthropic模型编程流量占比曾达80%,后谷歌Gemini 2.5 Pro等抢占份额,其跌至25%以下,Claude 4发布后份额回升。还介绍了OpenRouter特点。
AI辩论能力碾压人类,81.7%概率让你信服!研究登Nature子刊
《自然·人类行为》研究指出,在线辩论中,大语言模型根据对手特征个性化论点时,比人类更具说服力。实验显示,与GPT - 4辩论的参与者有81.7%更高概率认同其观点,应加强对大模型舆论操控的监管。
ICML 2025 Spotlight | 多模态大模型暴露短板?EMMA基准深度揭秘多模态推理能力
最新研究推出 EMMA 基准测试,揭示顶尖多模态大语言模型在深度视觉与文本融合的复杂多模态推理上显著不足。该研究已被 ICML 2025 接收,代码数据开源。实验表明,现有模型与人类专家差距大,视觉推理是核心瓶颈。
通义实验室新研究:大模型自己「扮演」搜索引擎,提升推理能力无需搜索API
阿里通义实验室开源ZeroSearch,提供无需与真实搜索引擎交互的强化学习框架。它用模拟搜索环境和渐进式抗噪训练,让LLM自给自足,节省API成本,在多问答数据集表现优,为智能化检索提供新思路。
紫东太初推出GMC核心集剪枝方法,少80%Token仍满血保真多模态能力
视觉Token冗余是多模态模型高效推理与落地的瓶颈,传统筛选方法有缺陷。紫东太初团队提出GMC核心集剪枝方法,具双阶段架构,优势多,实验显示其能在减少Token同时保持性能。