我的世界」共找到 11062 篇相关文章

新闻资讯8

刚刚,Thinking Machines Lab首次发长文,揭开LLM推理不确定性真相

Thinking Machines Lab发长文《克服LLM推理中不确定性》,指出大语言模型推理不确定性真正元凶是缺乏批次不变性,还解释核函数计算中数字加法顺序问题,介绍使核具有批次不变性方法并给出实验结果。

机器之心
新闻资讯7

兵临OpenAI!谷歌集结2500人「复仇」,Gemini 3夺回AI王座

谷歌发布Gemini 3欲夺回AI主导权。谷歌DeepMindCTO与AI Studio产品负责人剖析其发布盛况等,称这是与全球用户共建AGI实验,还谈到模型发展、应用及多模态等问题,也承认仍有提升空间。

新智元
算法论文8

小模型大作为!微博VibeThinker-1.5B超越DeepSeek R1等头部大模型

近年来,“参数越大,能力越强”成行业共识,但带来成本高和资源集中问题。微博AI团队开发VibeThinker - 1.5B用1.5亿参数和低训练成本,在多项测试中超越头部大模型,还提出SSP框架和MGPO算法。

深度学习自然语言处理
推荐文章8

Sam亲自泼冷水,GPT-5意外失手:们对AI期待,是否已被整个行业误判?

科技行业集体转向 AI,高管强调其变革性,可 OpenAI Sam Altman 却泼冷水,提醒投资者高估回报。文中围绕‘AI 是否放缓’展开讨论,还分析了 GPT - 5 发布遇冷原因、AI 对就业影响等,指出 AI 发展多且快,未来潜力巨大。

InfoQ
开源动态8

开源一周狂揽 7.6K Star!这个爆火「同事.skill」可以将“数字遗产”炼成 AI!

开源项目colleague-skill上线不到一周获7600+ Star。它由@titanwings开发,可凭同事材料生成能替其工作AI Skill,有双层架构、多源采集等亮点,还介绍了使用方法与项目结构。

开源星探
算法论文8

DeepSeek又又又又发新论文了!这一次,他们重构了AI看图方式

DeepSeek发布论文DeepSeek - OCR 2,指出传统AI看图方式有误,提出视觉因果流概念。其两阶段级联推理解法效果显著,还可能整合进即将发布DeepSeek V4,有望实现原生多模态。

花叔
新闻资讯7

光刻机霸主ASML被曝成为Mistral最大股东!网友怒斥:ASML钱将打水漂

9月7日消息,ASML注资15亿美元成Mistral最大股东,此举被视为加强欧洲科技主权关键一步。双方有望技术协同,不过网友看法不一,有人忧稀释权益,也有人认为或带来额外利润。

AI前线
新闻资讯8

谷歌诺奖大神哈萨比斯:五年内一半几率实现AGI,游戏、物理和生命本质都是计算

谷歌DeepMind掌门人Demis Hassabis与Lex Fridman深度对话,预测未来五年有50%几率实现AGI,还从新颖角度阐述自然界模式可被建模,畅谈AI对游戏、科学研究等多领域影响及应用。

AI科技大本营
产品应用7

消费级显卡跑大模型训练门槛再降:Qwen3-1.7B强化学习只需5GB显存

消费级显卡跑大模型训练门槛再降,Unsloth AIFP8精度强化学习方案让Qwen3 - 1.7BGRPO训练只需5GB显存且性能无损。该方案与TorchAO合作,有推理优势,还在内存优化等方面表现出色。

AI工程化
算法论文8

NUS LV Lab新作|FeRA:基于「频域能量」动态路由,打破扩散模型微调静态瓶颈

在大模型时代,参数高效微调(PEFT)已成为迁移大规模扩散模型至下游任务标准范式。但现有微调方法多采用「静态」策略,忽略扩散生成过程内在规律。新加坡国立大学LV Lab等机构提出FeRA框架,通过频域能量动态路由,实现高效微调。

机器之心