三层评测框架」共找到 2237 篇相关文章

算法论文8

两个LLM互相对线,推理能力起飞:康奈尔团队发布大模型版类GAN训练法

康奈尔大学团队提出面向大语言模型的类GAN训练框架PasoDoble,通过对抗训练两模型提升推理能力,不依赖外部监督,在多模型实验中显著提升数学基准表现,不过在部分领域外任务有局限。

机器之心
产品应用8

Eino ADK:一文搞定 AI Agent 核心设计模式,从 0 到 1 搭建智能体系统

大语言模型发展下,Agent成AI落地主流,但传统开发有痛点。Eino ADK为Go开发者提供智能体开发框架,解决核心难题,还介绍了Agent功能、ADK模式、构建方法及多Agent协作场景等。

InfoQ
推荐文章7

为什么95%的智能体都部署失败了?这个圆桌讨论出了一些常见陷阱

硅谷圆桌论坛指出,95%的AI智能体部署失败,原因并非模型不智能,而是基础框架、上下文工程等未成熟。还探讨了上下文工程实践、信任治理、记忆设计、多模型编排等问题,给出创业者需思考的问题。

机器之心
新闻资讯8

AI也能当情感大师?腾讯发布最新AI社交智能榜单,最新版GPT-4o拿下第一

腾讯混元AI数字人团队打造SAGE自动化评估框架,可评价AI“共情力”与能否成“知心伴侣”。研究团队用其对18个主流模型测评,GPT - 4o表现最佳,还通过多实验分析模型特性。

量子位
推荐文章7

一文看懂英伟达的产品体系和命名规则

文章由小枣君撰写,详细梳理英伟达产品体系和命名规则,涵盖算力芯片、超级芯片、超级计算机平台等,介绍各层级产品特性,还提及通信技术、开发框架CUDA,助读者清晰了解英伟达产品。

芯师爷
开源动态8

GitHub 23.6k star 的 BMAD Method:如何把大模型系统提示词,变成一支“可复制的 AI 开发团队”?

BMAD Method是开源的AI驱动敏捷开发方法论与工具集,基于BMAD Core框架,有19个专业AI角色和50+条工作流,获23.6k颗GitHub Star。它解决了大模型使用痛点,将AI开发工程化,可在多工具复用。

小华同学ai
新闻资讯7

鼠标的未来是手环?解码肌肉信号,Meta黑科技登上Nature

Meta推出非侵入性神经肌肉交互系统,利用手腕表面肌电图(sEMG)实现人机交互,该技术登上7月24日的Nature。实验在连续手势控制、离散手势控制和打字三个任务评测效果不错,适合特殊人群,也能弥补脑机接口数据不足。

新智元
算法论文8

重写手机AI安全边界!首个MoAI攻防SoK,系统梳理三大安全支柱

墨尔本大学等联合发布论文指出,移动端AI硬件和模型发展使MoAI成重要范式,但带来安全风险。论文给出统一框架,拆解系统为四层,定义三大安全支柱,梳理攻击、防御图谱等,还提出开放问题与未来方向。

新智元
算法论文8

Monet:赋予多模态大模型如人类一般的抽象视觉思考能力

文章介绍了Monet模型,它实现了训练MLLM直接在连续隐空间思考的方法,内化视觉思考能力。还阐述了多模态模型隐式推理训练的难点,提出SFT+RL训练框架,构建数据集,经测试,Monet提升了视觉推理能力。

机器之心
产品应用8

全球AI双榜第一!力压谷歌Veo与Grok,Vidu Q3「参考生」之王归来

这个月初谷歌免费开放Veo 3.1视频生成能力,让AI视频更普及,但模型距‘能交付’仍有差距。Vidu Q3带着‘全家桶’回归,覆盖多领域,在权威评测榜单成绩优异,视觉、听觉和场景能力升级。

新智元