2.0版本」共找到 2729 篇相关文章

新闻资讯7

AI圈水太深:OpenAI保密、Meta作弊!国产MoE却异军突起

文章梳理大语言模型发展,从传统稠密架构到稀疏MoE架构,参数从百亿到万亿。介绍OpenAI、Meta等厂商模型,如GPT系列、Llama系列,还提及Mixtral、DeepSeek V3等。指出Meta作弊丑闻,国产MoE模型异军突起。

新智元
新闻资讯7

小扎开价14亿让他换个地方打工,库克连挽留尝试都没有

苹果基础模型团队负责人庞若鸣跳槽Meta,原因是扎克伯格给出约14亿人民币薪酬包。Meta为挖顶级AI人才不惜重金,其超级智能实验室薪资远超正常水平,引发内部文化争议。

量子位
产品应用7

眼馋苹果刚发布的液态玻璃效果?藏师傅教你提示词一键实现

苹果 WWDC2025 发布的液态玻璃效果引关注,虽卡片中心可读性差,但预计会被广泛使用。藏师傅探索出将其融入网页生成的提示词,介绍了在不同模型上的效果及提示词内容和使用注意事项。

歸藏的AI工具箱
产品应用7

新版DeepSeek R1你得这样用,太爽啦~

前几天DeepSeek R1悄悄更新,作者测评发现,起初用复杂提示词,它比Claude4有明显差距;换成一句话提示词,生成效果质的飞跃,代码能力大幅提升接近Claude4,写作小提升,数学能力提升不大。

开源星探
开源动态7

DeepSeek最新模型意外泄露~

DeepSeek最新模型DeepSeek-V3-0526疑似泄露,消息源于https://docs.unsloth.ai/basics/deepseek-v3-0526-how-to-run-locally ,其性能媲美GPT - 4.5 / Claude Opus,或成最强开源模型,信息若属实将很快发布。

PaperAgent
推荐文章7

【CUDA 博客】使用PTX指令更高效地加载和存储矩阵

文章围绕使用PTX指令高效加载和存储矩阵展开,介绍`ldmatrix`和`stmatrix`指令格式、适用GPU版本、地址计算逻辑等,给出不同矩阵数量的实现代码示例,助读者理解和应用。

GiantPandaLLM
开源动态8

卡内基梅隆大学开源LegoGPT,用AI设计乐高模型

卡内基梅隆大学开源LegoGPT,可依文本提示生成物理乐高模型。它把乐高设计转为自回归文本生成任务,基于LLaMA - 3.2 - 1B - Instruct微调,应用场景广泛,如教育、玩具设计等。

AIGC开放社区
算法论文8

Transformer祖传设计遭暴击,COLM顶会三篇论文发难

COLM 2026上,三篇论文对Transformer关键技术发难。《Cracks in the Foundation》指出长上下文架构选择影响大;《Lost in Backpropagation》揭示输出投影层信息损耗严重;《When Fewer Layers Break More Chains》表明层剪枝影响长链推理。

量子位
新闻资讯8

OpenAI新模型让数学家集体破防?一场关于数学未来的精神危机

OpenAI下一代主要模型Astra内部版本在多数学领域给出十项新研究结果,让数学界震动。数学家看法不一,有人惊叹,有人迷茫,还有文章指出这或引发数学学科意义的精神危机。

机器之心
产品应用7

A社你解释下,啥叫Sonnet 5比Fable 5还贵?

Anthropic推出新版性价比模型Sonnet 5,定位为“最能干活”,能力提升但价格暗藏玄机。开发者实测发现,新分词器使Token消耗增加,实际花费可能比Opus还高,且有性能相近但价格更低的替代模型。

量子位