「指令遵循率」共找到 612 篇相关文章
MCP协议曝出大漏洞:会泄露整个数据库
最新研究显示,MCP协议存在重大漏洞,攻击者可利用LLM的指令/数据混淆漏洞直接访问数据库。研究者基于Supabase搭建系统演示攻击过程,还给出降低风险的解决措施。
一句话生成任务专属LoRA!Transformer作者创业公司颠覆LLM微调
Transformer作者之一创立的SakanaAI推出Text-to-LoRA(T2L),简化模型适配流程,省却繁琐微调。T2L参数压缩率达80%仅降1.2%准确率,零样本场景平均准确率78.3%超现有SOTA方法,开启“一句话定制模型”时代。
李静海院士团队:未来数据系统的逻辑与架构 | Engineering
本文展望数据科学未来,强调其对AI重要性。探讨科学数据系统挑战,提出收集处理原则,指出要重视数据系统逻辑与架构研究,建立标准协议框架,促进AI健康发展。
黄仁勋100万亿预言兑现!易鑫Voice Agent落地,汽车金融迎效率革命
2024年GPT - 4o问世后,Voice Agent创业公司涌现,但通用方案在金融等场景「水土不服」。易鑫深耕汽车金融,自研工业级Voice Agent系统,采用Model + Harness方法论,实战数据亮眼,还将向泛金融领域延伸。
The Batch: 951 |让助手始终保持“帮助状态”
通常大语言模型被训练成有帮助、无害、诚实的助手,但长时或激烈对话中会有不理想特征。研究人员提出稳定 LLM 助手人格的方法,定义 assistant axis 纠正偏离,测试显示该方法有效且不降低模型表现。
姚顺雨署名:大模型「现学现卖」能力首次被系统评估,腾讯、复旦联手发布CL-Bench
腾讯混元团队和复旦大学研究人员联手推出全新基准测试CL - Bench,系统性评估大模型上下文学习能力。测试显示十大前沿模型表现不佳,揭示当前大模型在该能力上的普遍短板,并指出未来四个探索方向。
刚刚,DeepSeek开源OCR 2,首创Qwen编码的「双流架构」
年底 DeepSeek 开源新模型 DeepSeek - OCR 2,首创双流注意力架构,model&paper 一同发布。它重构视觉编码器,采用三阶段训练流程,在 OmniDocBench v1.5 评测及生产环境验证中表现良好。
万赞!别把AI当搜索,10个让AI效率提升10倍的技巧
Greg Isenberg基于Anthropic官方研究拆解10个让Claude效率提升10倍的技巧,解决AI'幻觉'等问题,涵盖协作语气、明确性原则等方面,虽以Claude为例,但对其他AI也适用。
GPT-5.2来了…
OpenAI推出GPT - 5.2系列,是适合专业知识工作的模型。它在专业工作表现、编程能力、可靠性与安全性等多方面有提升,定价公布,已向付费用户逐步推出,此次更新重在夯实基础。
AAAI 2026 | 北航、东京大学填补AI「语义鸿沟」,过程感知视频理解如何找到「状态」锚点?
北航陆峰教授团队联合东京大学,提出视频理解新框架 TSS,引入“状态”作视觉锚点,解决抽象文本指令与具象视频对齐难题,已被 AAAI 2026 接收,代码已开源。