VAE-LLM数据增强」共找到 3299 篇相关文章

新闻资讯7

个人开发者训400亿参数大模型:分布式算力,DeepSeek架构,3090单卡部署

Nous Research推出Psyche Network,可整合全球算力训练AI。它基于Deepseek的V3 MLA架构,有DisTrO优化器等技术,能让个人和小团体创建大规模模型,还实现40B参数LLM预训练。

量子位
开源动态8

Hugging Face开源AI Sheets:零代码调用千种模型,数据处理超简便!

Hugging Face团队开源AI Sheets,这是无代码工具,有类似Excel界面,集成数千开源模型处理数据,支持批量处理、模型比较等,支持本地和在线部署,在多方面优于同类工具。

开源星探
推荐文章7

OpenAI分享了一份上下文工程实用指南。

OpenAI产品负责人Miquel联合Piotr发布Context Engineering深度指南。介绍了Context Engineering概念、6种核心上下文,指出RAG只是其中一环,还讲述信息检索的多种范式及上下文组装方法。

探索AGI
算法论文8

细粒度视觉推理链引入数学领域,准确率暴涨32%,港中文MMLab打破多模态数学推理瓶颈

香港中文大学MMLab团队发布MINT - CoT视觉推理方案,解决多模态数学推理难题。它引入特殊Interleave Token,构建专属数据集,采用三阶段训练策略,实验效果全面超越现有方法。

量子位
新闻资讯7

被高薪吸引却遭愚弄!科学家怒曝AI科研黑幕:多为个人“捞金”,DeepMind百万成果是“垃圾”

物理学家 Nick McGreivy 分享应用 AI 做研究的经历,指出 AI 在解决偏微分方程上效果不佳,与宣传不符。他还提到 DeepMind 成果遭质疑,研究存在数据泄露、报告偏差等问题,认为 AI 在科学领域没那么成功。

AI前线
算法论文8

北大伯克利联手“拷问”大模型:最强Agent也才40分!新基准专治“不听话”的AI分析师

北大与伯克利团队推出IDA - Bench新基准,模拟真实数据分析场景,解决现有基准无法评估大模型在动态交互中可靠性的问题。测试显示,顶尖大模型成功率最高仅40%,不同模型还暴露多种问题。

量子位
新闻资讯7

Anthropic偷偷在Claude Code中植入了隐形代码,只为识别中国用户。

近期Claude大面积封号,国内用户几乎被封完。Reddit大佬逆向Claude Code发现,其会静默读取本地信息,通过操作系统时区和环境变量识别中国用户,用隐写术传输标记数据,引发开发者不满。

数字生命卡兹克
开源动态8

不改模型、不降质量,谷歌让Gemma 4快了3倍:本地跑大模型彻底变天

谷歌给Gemma 4家族更新Multi - Token Prediction推测解码架构,推理速度最高提升3倍且输出质量不变。介绍了LLM推理慢的原因、MTP解决办法、对开发者的利好、技术细节、使用方式等。

AI寒武纪
新闻资讯7

全球云数据库巨头收购Crunchy Data,增强AI Agent能力

全球云数据库巨头Snowflake宣布收购Crunchy Data,发布新型Postgres数据库Snowflake Postgres,满足企业级AI和事务系统需求,具有安全合规等特点,有三大特色功能,推动其成为企业数据负载目的地。

AIGC开放社区
算法论文8

警惕!大模型成本倒挂:你正在为模型的多余「思考」买单

一项来自多所高校和微软研究院的研究揭示AI模型价格倒挂现象,低定价模型可能产生更高实际开销。研究聚焦8个前沿推理模型和9个主流数据集,指出推理token是成本倒挂主因,且实际开销难以预测。

机器之心