能碳产业大模型」共找到 10474 篇相关文章

新闻资讯7

抨击AI炒作、曝企业需求为先,Anthropic 联创:模型提 0.01 性就血赚,算力烧钱但值!

Anthropic由7位前OpenAI核心成员创立,联合创始人兼总裁Daniela Amodei接受采访,谈到成本控制、AI安全及上市可。她认为AI安全是核心优势,公司谨慎对待支出和算法效率,虽算力投入大,但硬件回报高。

AI前线
开源动态8

模型否为不同硬件平台生成高性内核?南大、浙大提出跨平台内核生成评测框架MultiKernelBench

深度学习计算依赖底层内核,当前多由开发者手工编写。南大、浙大推出开源评测框架MultiKernelBench,打破现有评测基准局限,构建模块化评测体系,多模型实测,还指出LLM短板并明确未来方向。

机器之心
算法论文7

LLM的RL训练轨迹竟然是线性的?Miaow Lab|新工作:无需继续训练,直接“预测”未来模型

文章介绍《Not All Steps are Informative: On the Linearity of LLMs' RLVR Training》,揭示RLVR训练中LLM权重和输出概率线性变化,提出“权重外推”法,可实现6.1倍训练加速,还介绍三种策略及实验结果。

AINLPer
算法论文8

全新GPU高速互联设计,为大模型训练降本增效!北大/阶跃/曦智提出新一代高带宽域架构

随着大模型参数规模扩大,分布式训练成关键路径,高带宽域设计对提升训练效率至关重要。现有HBD架构在可扩展性、成本和容错力等方面有局限,北大、阶跃、曦智团队提出InfiniteHBD架构解决问题。

量子位
7

代码里插广告,腾讯 Codebuddy 们 “背锅”?DeepSeek “极你太美”事件,其他模型也逃不掉?

网友发现腾讯 Codebuddy 改写代码时插入广告,字节 Trae 国内版生成结果有‘极’字 bug,根源指向 DeepSeek V3.1。除 DeepSeek 外,Gemini、Grok、Qwen3 等模型也有类似问题。大家对原因有多种猜测。

InfoQ
算法论文7

基于大模型的领域场景开发:从单智体到多智体的React框架设计与实现

作者团队经历从提示词工程到流程编排模式各阶段,现设计架构升级,选用层级指挥模式的React框架,实现单智体对工具调用的反思规划,后续还将迭代实现多智体协作,同时提及技术选型、系统架构等内容。

阿里云开发者
产品应用8

基于大模型(LLM)的自选股智分析系统,让AI帮你盯盘,每天自动推送分析报告

daily_stock_analysis是基于LLM的自选股智分析系统,免费零成本运行,获6.3万Star。它多市场覆盖、聚合多源数据,自动生成决策报告并推送。有零成本运行等五大亮点,还给出上手步骤、适合人群。

机器学习AI算法工程
新闻资讯7

给AI打个分,结果搞出17亿估值独角兽???

模型竞技场LMArena官宣拿下1.5亿美元A轮融资,估值升至17亿美元。它前身是Chatbot Arena,由LMSYS创建,核心成员多为顶尖高校学霸。LMArena评估规则有趣,成新模型必测榜单,计划用新资金运营平台、扩团队。

量子位
新闻资讯7

1 亿美元 ARR、不设 AI 硬件产品经理,Plaud 如何拿下全球百万用户?

本文采访了Plaud中国区CEO莫子皓。他表示Plaud更像大模型公司,硬件是获取用户context的入口。还谈到职业经历、大模型在医疗应用原因,指出做硬件要补短板,产品迭代谨慎且快,目标是拓展智边界。

InfoQ
新闻资讯7

马斯克吹牛了吗?Grok 4第一波实测出炉:既完虐o3,也菜到数不清6根手指

马斯克称Grok在各学科达博士后水平,激起网友兴趣。博主测试显示Grok 4在多项测试中完胜o3,网友还用它写游戏、让概念可视化。不过Grok 4也有翻车表现,马斯克称其仍有改进空间。

机器之心