「语言驱动」共找到 1662 篇相关文章
CodeClash 通过多轮编程竞赛对大型语言模型进行基准测试
为评估大型语言模型(LLM)编码能力,斯坦福、普林斯顿和康奈尔研究人员开发 CodeClash 基准测试,让多个 LLM 在多轮比赛中较量,涉及多种代码竞技场,还评估模型分析代码库能力,未来将处理更大代码库。
LLM 驱动的 AI Agent通信:协议、安全风险与防御对策
论文围绕智能体通信的协议、安全风险及防御对策展开探讨。介绍兴起与重要性、定义分类、解析多种协议,分析不同交互的安全风险,提出防御对策,还以MCP和A2A为例做攻击实验,给出未来研究方向。
扩散语言模型写代码!速度比自回归快10倍
Inception Labs推出基于扩散技术的大语言模型Mercury,它突破自回归模型限制,生成速度快,还解决了难以回头调整的问题。实测显示其代码生成速度比传统工具最多快10倍,且有强大纠错能力,但面临与当前CI能力不匹配问题。
Google刚刚开源的一款AI工具,Gemini 2.5驱动浏览器自动化!
Google在GitHub开源AI浏览器自动化工具Computer Use Preview,基于Gemini 2.5模型,用自然语言控制浏览器完成复杂任务。支持双环境,集成Gemini API/Vertex AI,适用于Web测试等,零代码入门。
上交×蚂蚁发布 DiagGym:以世界模型驱动交互式医学诊断智能体
上海交通大学与蚂蚁集团等团队提出新训练框架,构建面向医学诊断的世界模型DiagGym,训练诊断智能体DiagAgent,还设计评测基准DiagBench。实验显示该框架下的智能体表现优于先进模型,代码等已开源。
官宣!姚顺雨出任腾讯首席AI科学家,带队大语言模型、AI Infra
12月17日腾讯官方消息,腾讯升级大模型研发架构,新成立AI Infra部等。姚顺雨出任首席AI科学家,兼任AI Infra部、大语言模型部负责人,他在智能体方向成果多,论文总引用超1.9万。
ACL'25首届博士论文奖 | 重新思考 LLM 中的数据使用
近日,第一届 ACL 计算语言学博士论文奖获得者是 Sewon Min,其论文《重新思考大型语言模型中的数据使用》围绕大型语言模型如何使用训练所用的庞大文本语料库展开研究。
从数据到决策:AI 驱动的 Quick BI 架构设计与实践
阿里云智能集团瓴羊高级技术专家王璟尧,介绍阿里云 Quick BI 从传统 BI 到 AI 驱动的智能 BI 的进化,解析领域大模型与 BI 引擎协同设计等技术权衡,为行业提供可复用技术范式。
视觉优势还是语义依赖?揭秘 DeepSeek-OCR 高压缩率背后的真相
中科院等团队论文剖析 DeepSeek - OCR,通过实验揭示其高压缩率下准确率高或依赖语言先验。去掉语言先验,准确率暴跌;下游任务推理崩塌,长文本处理也有瓶颈。
AI 驱动的智能异常处置:从异常发现到根因定位
在 2025 年 QCon 全球软件开发大会(北京站)上,阿里云算法专家张颖莹分享《AI 驱动的智能异常处置:从异常发现到根因定位》。她介绍阿里云计算平台运维挑战,给出算法选型与设计思路,还提及后续平台建设规划。