幻觉降低」共找到 1060 篇相关文章

推荐文章7

小模型代替顶级闭源:微软用4B小助理,砍掉30% Token消耗

微软研究团队提出实用方案,用4B参数的微型模型Terminus - 4B替换昂贵顶配大模型接管终端执行任务,采用SFT和RL策略打造子智能体,经测试效果良好,节省Token消耗。

AIGC开放社区
新闻资讯8

百度想明白了:旧供给到达极限了

当下企业应用AI时,Token成本高、推理效率低问题凸显。百度Create大会释放旧供给达极限信号,推出新全栈AI云,含Agent Infra和AI Infra两层架构,多个场景应用初显成效。

InfoQ
新闻资讯8

领先于Transformer!新架构首个1200万上下文模型SubQ,成本仅Opus的5%

Subquadratic公司提出SubQ模型,核心是SSA亚二次稀疏注意力机制。该机制改变注意力计算分配,让模型真正读长文档。SubQ是首个有1200万token上下文窗口的前沿模型,成本低、速度快,有望革新大模型扩展路径。

机器之心
开源动态8

SafeHarness:告别防御盲区,为智能体Harness穿上「全生命周期安全护甲」

在自主AI智能体生态中,Harness是核心组件却易成攻击目标。中国科学院信息工程研究所等推出SafeHarness框架,将防御机制融入智能体Harness运行生命周期,解决现有安全工具缺陷,实现系统级协同防御。

深度学习自然语言处理
产品应用8

「双线实测」Qwen 3.6-Plus,Agentic Coding 已经这么能“扛活儿”了?

4月7日阿里云通义千问Qwen3.6-Plus上线,作者用两套真实复杂任务评估其智能体能力。结果显示它在复杂决策和编码任务表现出色,有工业级交付水准,但也有首字延迟等短板,且参数效率优势明显。

AI科技评论
产品应用8

能查信息≠循证AI:OpenEvidence爆火在前,中国医生的「信任死结」谁来解?

AI医疗市场增长快,但国内落地面临医生信任难题。医渡科技发布的医渡智循,通过全流程技术体系、多专科智能体协作等,解决AI信任问题,实现全场景布局,让AI回归循证。

AI科技评论
产品应用7

Claude Code auto mode 解析:如何用 AI 分类器替代人工审批

Anthropic 发布 Claude Code 的 auto mode 解决审批疲劳问题,用 AI 分类器替代人工审批。介绍了其核心思路、判断危险的标准、两阶段分类等,还分析了漏检率、被拦截后的处理及子 Agent 检查等,也指出了目前局限。

宝玉AI
开源动态8

一夜之间,AI终获「永久记忆」!最难考试99%刷爆SOTA,全网直呼疯狂

新智元报道,Supermemory团队推出超级记忆系统ASMR,在AI记忆界最难考试LongMemEval中刷到99%准确率。它抛弃传统模式,采用多Agent并行推理,4月初将开源代码。此外,其背后的Supermemory引擎功能强大,能让AI真正拥有记忆。

新智元
新闻资讯7

独家发布 Qclaw 24 小时后,OPC 们涌入观猹,等一个邀请码

腾讯发布桌面 Agent 工具 QClaw 后热度飙升,逼近字节豆包。因其可通过微信调用,安装门槛低。观猹成 AI 产品冷启动首选平台,还衍生出龙虾到家服务,观猹员真实评价助产品迭代。

特工宇宙
算法论文8

模型砍掉一大半,准确率反升15%!华科&阿里安全新研究实现ViT近乎无损的类特定压缩|ICLR'26

华中科技大学联合阿里安全部提出Vulcan方法,一改传统压缩策略,通过“先训练再剪枝”实现ViT近乎无损的类特定压缩,为大模型服务小场景提供新路径,论文已被ICLR 2026接收。

量子位