LLM评估」共找到 1596 篇相关文章

算法论文8

模型是谁的?LLM版权保护首个技术综述论文发布

浙江大学和君同未来团队发布《Copyright Protection for Large Language Models: A Survey of Methods, Challenges, and Trends》。论文以“模型指纹”为核心理念,打通三个技术流派,指出文本水印难护模型版权,还分析各类指纹技术优劣势并给出未来方向。

深度学习自然语言处理
算法论文8

EMNLP2025 | LLM多次回答一致就一定正确吗?非也

随着LLMs在高风险领域广泛应用,其输出的事实性错误引发安全质疑。中科院计算所和美团团队论文揭示自我一致错误,传统检测方法对此失效,提出跨模型探针法提升检测能力。

深度学习自然语言处理
算法论文8

不训练,解锁Agentic智能!微软:只需给LLM一台电脑

人大、MSR、清华的LLM - in - Sandbox开启「通用代理智能」新范式,把大模型放进“虚拟机”,让其在6大任务上成绩全线暴涨,零额外训练解锁“通用代理智能”,还介绍了相关实验、优化及效率情况。

PaperAgent
新闻资讯7

刚刚!Thinking Machines Lab | 长文揭开LLM推理不确定性真相!

Thinking Machines Lab发布《克服LLM推理中的不确定性》,揭示大语言模型推理不确定性原因,并非“并发 + 浮点”假设那么简单,主要是负载及batch size不确定所致,还给出让核函数有批次不变性的方法及实验结果。

AINLPer
算法论文7

全面评估多模态模型视频OCR能力,Gemini 准确率仅73.7%

MME - VideoOCR团队评估多模态大模型(MLLM)视频OCR能力。构建精细任务体系和高质量数据集,评测18个主流MLLM。即便如Gemini - 2.5 Pro,准确率仅73.7%,暴露出MLLM在视频OCR领域能力局限。

量子位
新闻资讯7

LLM会梦到AI智能体吗?不,是睡着了也要加班

新智元报道,Bilt部署数百万智能体,让AI在“睡眠”中整理记忆,评估互动,决定信息存储位置。AI记忆与人脑差距大,Bilt和Letta实验展现“主动智能”雏形,提高模型表现。行业也在突围AI记忆缺陷问题。

新智元
算法论文8

LLM 驱动的 AI Agent通信:协议、安全风险与防御对策

论文围绕智能体通信的协议、安全风险及防御对策展开探讨。介绍兴起与重要性、定义分类、解析多种协议,分析不同交互的安全风险,提出防御对策,还以MCP和A2A为例做攻击实验,给出未来研究方向。

PaperAgent
产品应用8

生产级Prompt自动化推理评估A/B实验结果的工程实践

本文围绕生产级Prompt自动化推理评估A/B实验结果展开,介绍系统背景与痛点,展示主Prompt和决策树,用deepseek - r1等模型推理。通过分析Bad Cases优化Prompt,总结设计原则和迭代方法,还给出通用启示与展望。

阿里云开发者
开源动态7

Unsloth-MLX:在Mac上微调LLM,代码无缝迁移到云端GPU

对于Mac用户,在原型实验阶段反复租云端GPU是资源浪费。开发者推出Unsloth - MLX,基于MLX框架,让Mac用户本地高效微调大模型,改一行导入语句就能无缝迁移代码到云端,还介绍项目特点、状态等。

AI工程化
算法论文8

苹果再发论文:精准定位LLM幻觉,GPT-5、o3都办不到

近日苹果发布重磅论文,提出 RL4HS 方法,用强化学习训练模型,能准确标出答案中幻觉部分,还使用片段级奖励和类别感知的 GRPO,在片段级幻觉检测任务上超 GPT - 5 和 o3。

机器之心