「基准测试成本」共找到 3377 篇相关文章
华为新开源!扩散语言模型突破32K上下文,还解锁了「慢思考」
今年文本生成领域从自回归向扩散语言模型转变,但长序列训练不稳定是痛点。华为发布 openPangu-R-7B-Diffusion,将上下文长度扩至 32K,在多基准创 7B 参数量级 SOTA,还解析了其技术革新。
硅谷大佬带头弃用 OpenAI、“倒戈”Kimi K2!直呼“太便宜了”,白宫首位 AI 主管也劝不住
硅谷正从昂贵闭源模型转向便宜开源替代方案。“SPAC 之王”Chamath Palihapitiya 团队将大量工作负载迁移至 Groq 平台的中国模型 Kimi K2,因其性能优且成本低。节目中还探讨中美开源模型现状等。
当 Kafka 架构显露“疲态”:共享存储领域正迎来创新变革
沃尔玛开发者 Ankur Ranjan 与 Sai Vineel Thamishetty 长期关注 Apache Kafka 与流处理系统。文章指出 Kafka 架构现局限,介绍下一代开源项目 AutoMQ 借助云原生设计,解决其成本、扩展性与运维痛点,为实时数据流架构提供新视角。
Anthropic 联创曝内部工程师已不写代码了,但工作量翻倍!开发者嘲讽:所以 Claude bug才那么多?
Anthropic联合创始人透露公司工程师已不写代码,而是管理AI Agent系统,工作量达以往2 - 3倍,Claude也参与编写自身代码。Dario提议向AI公司征税,开发者对AI写代码存质疑,还提到AI测试作弊等情况。
从少样本到千样本!MachineLearningLM给大模型上下文学习装上「机器学习引擎」
新研究 MachineLearningLM 提出轻量可移植「继续预训练」框架,突破 LLM 在上下文学习局限,能学上千示例,在多领域分类任务超基准模型。它有三项核心创新,效果惊艳且应用潜力大,还指明未来研究方向。
创始人跑路一年后,员工接盘把这家AI公司干到年入破亿!如今想含泪甩卖:真的“难以承受”
曾红极一时的AI聊天机器人公司Character.AI,在创始人跑路一年后,员工接管并聘请新CEO,业务有进展,预计年底年化收入达5000万美元,但运营成本高,还面临融资、竞争、监管等问题,正权衡出售或融资。
双“雷”暴击!Trae 被曝资源黑洞、Claude背刺超级付费党,开发者们被“刀”惨了
主打“自动化执行、多模型调用、上下文记忆”的AI编程应用大热,但也出现运行卡顿等问题。Trae被曝过度消耗资源,Claude Code对付费用户增加调用限制,凸显AI产品资源问题及厂商成本管控困境。
揭秘台积电未来战略核心——晶圆级系统集成
上周台积电研讨会公布2026 - 2028年技术路线图,其晶圆级系统集成技术SoW有新进展。半导体正从单一制程向系统级整合转型,台积电以制程与封装双轨驱动定义规则,还面临高成本等挑战。
实测GPT-6:AGI真来了!OpenAI缔造者都摸不到天花板
Astra发布,OpenAI联合创始人宣布AGI时代降临。虽官网文章曾“404”,但GPT - 6 Astra已问世。它在多项测试近乎满分,还在内测中展现强大能力,如PCB自动布局布线等,也突破诸多数学难题。
VLM会描述视频,却未必用对参考图:RefCaptioner让参考图与视频语义精准对应
多模态大模型处理多参考图与视频对应关系能力不足。为此提出 RefCaptioner,强化模型对参考图识别感应能力、优化输出格式与奖励函数;还构建 MRVBench 评测基准,实验显示其表现优异。