批处理不变性」共找到 1336 篇相关文章

新闻资讯7

腾讯混元挖走微软明星大模型团队!一作全员出走,新成果已跻身大模型竞技场TOP 10

微软明星大模型WizardLM一作全员加入腾讯混元,最新成果Hunyuan - Turbos跻身大模型竞技场TOP 10。此前WizardLM - 2发布顺,且微软将裁员超6000人,国内大厂正激烈争夺大模型人才。

量子位
新闻资讯7

谁杀死了那篇好论文?AI顶会乱象:好文被刷,低分论文捧上天

一位AAAI 2026审稿人在Reddit匿名爆料,称评审流程乱象丛生,好论文被拒、弱论文晋级,还有疑似“关系稿”。AAAI启用AI辅助审稿系统,本意提升效率,却让评审更可控,侵蚀学术信任。

新智元
算法论文8

借助CoT监管AI?OpenAI、谷歌、Anthropic等罕见联合发文:AI系统安全的新机遇!

OpenAI等支持新研究论文,其指出高级AI透明性有潜在风险,而‘推理模型’用自然语言推理带来可解释窗口,CoT监控可检测当行为、发现早期信号等,但也存在使监控性下降的因素。

PaperAgent
新闻资讯7

战火升级!奥特曼正式杀入脑机接口,这次用切脑

近日,奥特曼邀专家加入脑机接口创业公司Merge Labs,计划以8.5亿美元估值融资。它将采用非侵入式技术,与马斯克Neuralink的开颅手术竞争,奥特曼曾投资Neuralink但认同其侵入式做法。

新智元
新闻资讯7

首次曝光!OpenAI新一代旗舰Astra换上“循环深度”推理架构:用计算深度换参数规模

9月2日消息,OpenAI将推出的旗舰模型Astra采用“循环深度”新技术,用较小模型实现庞大模型性能,降低成本。但该技术会让AI推理过程可读,加重安全担忧,此前奥特曼已因Astra“能力过强”踩刹车。

AI前线
新闻资讯7

Claude 最歧视的,是印度阿三

AI研究员Aran Komatsuzaki实验发现,Claude的tokenizer对非英语用户友好,印地语用户消耗token是英语的3.24倍,带来高成本、高延迟等问题。同模型对同语言token处理有差异,市场份额影响token效率。

AGI Hunt
推荐文章8

2 亿美元 ARR,AI 语音赛道最会赚钱的公司,ElevenLabs 如何做到快速增长?

AI音频独角兽ElevenLabs估值66亿美元,从“小公司”成长为独角兽。其CEO回顾创业历程,分享心得,如结合研发与产品、融资绑定产品动态、靠三点优势被OpenAI取代等,还谈及人才、融资、业务等方面策略。

Founder Park
算法论文8

Sea AI Lab 揭秘:你费尽心力调的 LLM 一直在崩溃?罪魁祸首可能只是一个参数:BF16

Sea AI Lab 和新加坡国立大学研究指出,强化学习微调中训练稳定和性能瓶颈,根源是数值精度 BF16。其低精度造成“训练 - 推理匹配”,使训练易失败。将精度切换到 FP16 可解决问题,提升模型表现。

AI寒武纪
算法论文8

NeurIPS 2025 Spotlight | FSDrive统一VLA和世界模型,推动自动驾驶迈向视觉推理

面向自动驾驶的多模态大模型存在问题,FSDrive提出“时空视觉CoT”,让模型“以图思考”,联合未来场景与感知结果进行可视化推理。该方法在改动原有MLLM架构前提下激活图像生成能力,实验表现出色。

机器之心
新闻资讯7

OpenAI即日起测试给ChatGPT用户加广告

OpenAI今日起在美国对已登录成年Free和Go订阅层级用户测试ChatGPT广告功能。广告影响回答内容,目的是为免费及低价服务提供资金。有看广告的办法,广告匹配有规则,隐私有保障,此次测试为收集反馈。

AI工程化