「深度学习算子」共找到 2012 篇相关文章
DeepSeek突然拥抱国产GPU语言!TileLang对标CUDA替代Triton,华为昇腾Day0官宣支持适配
DeepSeek v3.2开源TileLang版本算子引关注,其可对标CUDA替代Triton,还适配国产算力生态,华为昇腾官宣支持。TileLang由北大团队主导,提供不同层次编程接口,助DeepSeek提升性能。
《DeepSeek掘金》背后的故事——从行业寒冬到AI春潮,用腾讯IMA知识库重构价值
本文讲述《DeepSeek掘金》成书背后的故事。从行业寒冬到AI春潮,编委们因DeepSeek迎来职业转机。面对出版市场乱象,用腾讯IMA知识库完成创作,还打造四位一体学习方案,致敬梁文锋与DeepSeek理想主义。
无需SFT也不用RL,样本级推理优化神器SLOT来了,准确率轻松+10%
西湖大学MAPLE实验室开发的SLOT方法,无需SFT和RL,让模型推理时“临时学习”具体问题。它简单易实现,计算开销小,能使模型准确率大幅提升,还无需额外资源,在各规模模型上效果显著。
Yoshua Bengio,刚刚成为全球首个百万引用学者!
计算机科学家Yoshua Bengio成Google Scholar上首个引用超百万的人。他是深度学习“三巨头”之一,在“AI寒冬”坚守研究,成果显著。如今他担忧AI风险,积极推动伦理准则和监管。
Anthropic 反杀 OpenAI,LLM 企业市场新格局
Menlo Ventures 报告显示,Anthropic 超越 OpenAI 成企业 LLM 市场新王者。代码生成成杀手级应用、强化学习成扩展路径、Agent 时代到来支撑其胜利。企业重性能,支出从训练转向推理。
突发!OpenAI新模型Astra吓瘫奥特曼:暂停训练两周,GPT-6训练一并冻结
OpenAI宣布暂停内部最强大模型强化学习,Astra模型暂停训练两周,GPT - 6也暂停。原因包括Hugging Face安全纰漏和Astra网络攻击能力越线。还采取物理隔离、严格监控、打击作弊等措施,或有营销意图。
我用MiniMax Agent开发了个带后端的全栈网站,全程0代码
2025年Agent成AI领域焦点,大厂纷纷布局。作者测试MiniMax Agent,发现其有四大特点:深度研究和上下文管理强,多模态输出出色,编程能力超预期,能执行定时任务,还能开发带后端的全栈网站。
库里被「采访」、杨紫被「演」短剧?别慌!蚂蚁AI鉴真拿下CVPR 2026冠军,专治黑产
深度伪造技术滥用,明星成换脸受害者,引发社会关注。蚂蚁集团AI安全实验室队伍MICV获CVPR 2026挑战赛冠军,还发布检测资源仓库。团队提出基于DINOv3的框架,解决AIGC检测难题,成果显著。
靠 AI起飞的千亿市值公司,如今要被AI“卷死”了?股价因GPT-5瞬间逆转、CEO亲承:我负有责任
语言学习平台 Duolingo 推行‘AI 优先’战略,虽遭反对但营收增长、股价上涨。不过 OpenAI 推出 GPT - 5 后,其股价急转直下,CEO 称对公众困惑负责,还被律所调查。
通义实验室新研究:大模型自己「扮演」搜索引擎,提升推理能力无需搜索API
阿里通义实验室开源ZeroSearch,提供无需与真实搜索引擎交互的强化学习框架。它用模拟搜索环境和渐进式抗噪训练,让LLM自给自足,节省API成本,在多问答数据集表现优,为智能化检索提供新思路。