「大厂自研」共找到 5843 篇相关文章
720美元套出A社死藏的Opus原始思维链,还是Haiku泄露的,GPT/Gemini也中招
研究人员发现,将大模型返回的加密推理块扔给同厂小模型让其复述,就能破解大模型隐藏的思维链。如Anthropic、OpenAI、Google的模型均中招,还会带来隐私、安全等风险,虽已打补丁,但仍有难题。
端到端语音模型:从语音表征到模型架构
本文整理自阶跃星辰语音模型负责人杨学锐在2025年QCon全球软件开发大会的分享。介绍大模型对语音技术的重塑,涵盖识别、合成等方面;阐述端到端语音模型构建,涉及表征、架构、训推和任务;还提及模型评估方法。
AI 的下一个战场:端侧模型崛起
大模型退烧,小模型接棒。腾讯、阿里等大厂纷纷官宣小模型成果,英伟达、OpenAI 等也有相关动作。端侧模型赛道广阔,但技术含量不低,面壁智能在端侧模型探索上成果丰硕,其 MiniCPM 系列不断迭代,还在多领域落地。
禁令之下,黄仁勋再用“阉割芯片”抢夺中国市场
美国芯片出口管制冲击英伟达,其在中国市场损失大、份额降。黄仁勋计划7月推‘阉割芯片’B20、B40/B30抢市场。不同客户有选择倾向,同时国产GPU有机会也面临难题,企业还尝试海外训练模型。
大模型「越用越快」!SpeedupLLM首次验证,大降56%推理预算
Emory大学研究者提出SpeedupLLM框架,利用动态计算资源分配和记忆机制,使LLM处理相似任务时推理成本降56%、准确率提升,论文系统性验证了LLM“越用越快”,为AI模型发展提供新思路。
LeCun出局,Meta变天!Llama 4翻车大清洗,「学院派」大败退
LeCun宣布年底离开效力12年的Meta,创立专注「世界模型」的AI公司。Llama 4翻车成其离职导火索,他的离去意味着学院派在Meta的AI战略中被边缘化,也预示硅谷AI路线之争进入新阶段。
DeepSeek-R1发布后的100天复现之旅方法总结
DeepSeek团队发布「推理大模型」DeepSeek-R1 ,其技术细节未完全开源,全球研究团队开启“复现竞赛”。论文总结100天复现经验,介绍推理大模型与普通大模型区别、复现方法、关键发现及未来方向。
LLM总是把简单任务复杂化,Karpathy无语:有些任务无需那么多思考
随着推理大模型和思维链普及,大模型有了‘深度思考’能力,但现在有些偏科,简单任务也复杂化。AI大牛Andrej Karpathy发长文指出该现象,认为是基准测试优化所致,大模型发展不能只追求分数。
湾大北交大开源 CutClaw,自动踩点音乐的 AI 智能视频剪辑师!
大湾区大学GVC实验室和北京交通大学团队开源CutClaw,它是模拟专业后期流程的多智能体系统,能实现音乐驱动剪辑,按文字指令自动剪辑,适配多平台,还可解构素材。操作简单,支持多模型。
太卷了!专属Coding的新一代Arena榜单来了,有国产模型登上榜首
大模型编程竞争激烈,编码能力提升成军备竞赛。LMArena发布新世代大模型编码评估系统Code Arena,国产模型智谱GLM - 4.6登上榜首,其编码能力获认可,彰显国产大模型硬核实力。