信任体系」共找到 744 篇相关文章

新闻资讯7

马斯克开始用Grok替代员工了!最惨部门裁员90%

据The Information消息,马斯克用Grok取代X员工,负责信任与安全问题的工程团队从超100人裁至不足10人。他意图用AI替代人力、自动化替代传统工程,还推进“巨硬计划”,但也带来权责不对等、安全问题和业务受阻等风险。

量子位
开源动态8

斯坦福&SambaNova联手发布ACE框架:上下文即战力

文章介绍了斯坦福与SambaNova联手发布的ACE框架。它解决传统提示工程缺陷,将提示工程升级为智能体自我演化体系。通过“生成 - 反思 - 策展”闭环,实现上下文低成本、低延迟、高扩展演化,小模型搭配它能击败大模型+传统提示。

CourseAI
开源动态8

真实科研水平集体不及格!全新基准SFE给主流多模态LLM来了波暴击

上海人工智能实验室AI4S团队推出SFE评测基准,首创三级评估体系,涵盖五大科学领域66项任务。评测显示主流MLLMs在高阶科学任务有挑战,不同模型、学科表现有差异,还构建了SciPrismaX平台推动AI科学评估生态发展。

机器之心
新闻资讯7

实证研究:AI杀猪盘比人类更强,已上岗缅甸

最近一项研究显示,在杀猪盘情感博弈中,AI比人类骗子更有耐心,更易赢信任。研究人员做了AI与人类诈骗对比实验,结果显示大家更相信AI。如今AI已进入诈骗园区,虽未全面替代人类,但诈骗或更隐蔽高效。

量子位
产品应用7

聊聊钉钉的悟空:给一个还没人走路的市场卖跑鞋?

钉钉发布悟空,与其他大厂先面向个人用户不同,它走企业级路线,有四层Skill体系等,虽初期被认为‘太重’,但钉钉全产品CLI化等创新有潜力,且安全设计是企业刚需,适合特定人群关注。

刘言飞语
新闻资讯7

为AI智能体选型、验收、优化提供量化依据:首部评估标准公开征集中

AI智能体成2025年十大战略技术趋势之首,到2028年至少15%日常工作决策将由其自主做出。但企业面临信任鸿沟,缺乏评估规范。首部聚焦AI智能体应用的团体标准公开征集起草单位与起草人,适用于多方,有核心内容与价值。

PaperAgent
算法论文8

PPO-Clip的「盲点」被补齐了?快手提出熵比裁剪方法,从局部约束到全局稳定的关键一跃

快手科技语言大模型团队提出熵比裁剪(ERC)方法,应对强化学习中信任域偏离问题。该方法从全局视角稳定策略分布,在多个数学推理基准实验中提升了模型性能,还与多种方法对比验证了泛化能力。

机器之心
推荐文章8

Agent Skill规范、构建与设计模式

文章深入解析 Agent Skill 的规范、构建与设计模式。介绍了 Skill 规范标准、三层渐进式加载机制和触发机制,阐述了 Skill-Creator 和 Writing-Skills 的核心思想,还总结了 Google 的 5 种 Skill 设计模式,最后指出 Skill 生态已形成完整知识体系

阿里云开发者
算法论文8

用「传心术」替代「对话」,清华大学联合无问芯穹、港中文等机构提出Cache-to-Cache模型通信新范式

随着大语言模型发展,多智能体系统中现有T2T交流方式有信息丢失、语义模糊、延迟大问题。清华等团队提出C2C信息传递方式,以KV - Cache为媒介,提升了正确率和速度,还介绍了实现路径、优势及应用前景。

机器之心
算法论文8

EMNLP 2025 | T2R-bench: 业内「首个」工业级表格生成报告评测基准

中国电信人工智能研究院推出业内首个面向真实工业场景的“表格到报告”基准T2R-bench,涵盖多领域真实表格、问题与人工标注关键点,配套创新性三维度评测体系。实验显示主流大模型在该任务上表现欠佳,提升空间大。

AINLPer