速度和准确性」共找到 7286 篇相关文章

推荐文章7

中学生就能看懂:从零开始理解LLM内部原理【八】| 什么是残差连接?

本系列是对长篇文章《Understanding LLMs from Scratch Using Middle School Math》的解读笔记。本篇介绍残差连接,指出传统多层模型有网络退化梯度传导困难问题,而残差连接能缓解,还说明了其工作原理可行性。

AI大模型应用实践
算法论文8

“最强具身VLA大模型”,究竟强在哪儿?

机器人基础模型π*0.6刷屏,能让机器人高效完成多项任务。它引入Recap学习法,突破传统模仿模式。其核心方法RECAP让VLA用奖励反馈人类介入训练,还能从异构数据学习,实现自我进化。

量子位
算法论文8

大语言模型离“数学证明高手”还有多远?斯坦福、伯克利、MIT 团队提出 IneqMath 评测标准

现在很多大语言模型常给出看似正确的结论,但推理过程却有问题。斯坦福、伯克利MIT团队提出新思路,构建IneqMath数据集及‘AI数学裁判系统’,研究发现很多模型推理不严谨,还给出两个提升准确率的办法。

AI前线
算法论文8

DeepSeek-V3再发论文,梁文锋署名,低成本训练大模型的秘密揭开了

DeepSeek 发布围绕 DeepSeek-V3 的技术论文,从硬件架构模型设计双重视角,探讨实现经济高效的大规模训练推理的方法。介绍了 DeepSeek-V3 的创新设计,如 DeepSeekMoE 架构、MLA 架构等,还给出未来硬件架构设计建议。

机器之心
新闻资讯7

OpenAI偷装Anthropic Skills实锤,ChatGPT、Codex已植入!开发者实测11分钟造PDF:比MCP强!

近日开发者发现 OpenAI 悄悄支持了 Claude 构建的 Agent Skills 机制,内置 excel、word pdf 等技能。其实现理念与 Anthropic 相似,且 Skills 支持功能已落地 ChatGPT Codex。业内对 Skills 看法不一,但它为智能体发展带来新方向。

InfoQ
开源动态8

性能大涨!阿里开源新版Qwen3模型,霸榜文本表征

今日凌晨阿里开源Qwen3-EmbeddingQwen3-Reranker两款新模型,专为文本表征等任务设计,支持119种语言。测试显示其性能出色,在多语言文本表征排序任务中超越众多模型,还采用了多种创新设计与训练方法。

AIGC开放社区
新闻资讯8

黑马图像模型被Nano Banana技术负责人点赞!15人华人小队,DDIM之父&CVPR最佳论文作者带队

Luma AI推出全新图像模型Uni - 1,对标谷歌Nano Banana ProGPT Image 1.5。它是统一图像理解与生成模型,多项评测表现出色。背后是不到15人的华人团队,由DDIM之父CVPR最佳论文作者带队。

量子位
新闻资讯8

李志飞:1 个人、2 天做出 AI 时代的「飞书」,真正的 Founder Mode

出门问问创始人李志飞在「TicNote」发布会上分享「一人公司」实验。他用AI编程工具2天做出AI时代“飞书”原型,还谈了使用AI编程问题、对智能Agent思考等,重新找回AGI信仰。

Founder Park
开源动态8

开源 AI 文档生成器!给代码库做个CT扫描,一键生成交互式Wiki文档!

介绍开源工具DeepWiki-Open,它由AsyncFuncAI开发,能将GitHub或GitLab仓库一键转为交互式Wiki,基于多种技术实现代码分析自动化文档生成,解决开发者理解复杂代码库的痛点,还给出快速上手步骤适用人群等。

开源星探
推荐文章7

大模型之外,向量存储如何支撑 Agent 的检索链路

文章指出大模型负责理解、推理生成,而Agent需获取外部数据等。向量存储可将数据转化为语义向量,在Agent执行任务时找回相关内容。文章探讨向量存储技术方向,分享做法,还演示阿里云两种Serverless向量存储用法。

阿里云开发者