「同质化评估」共找到 1447 篇相关文章
国产算力正在进入Token标准化时代
2026年6月17日,是石科技攒局国产异构算力创新发展论坛。其创始人闫博文认为国产算力瓶颈在工程化转化能力。是石科技正将异构算力转化为标准化Token生产能力,还启动B轮融资。
AI实力榜大洗牌!OpenAI谷歌强势领跑,Anthropic节节败退
Poe最新报告显示,2025年1 - 5月AI各领域市场份额大洗牌。OpenAI和谷歌势头猛,Anthropic掉队。文本生成、推理、图像等各领域竞争激烈,企业需搭建评估体系,按需选模型。
Lucide 1.0 发布,移除品牌图标,并缩减数百万个项目的包大小
Lucide 1.0 发布,它是开源图标工具包,是 Feather Icons 分支。此次移除品牌图标,缩减 lucide - react 包大小,还引入上下文提供程序等改进,社区反响有赞有弹。
上下文工程(Context Engineering)综述:大模型的下一个前沿
文章提出“上下文工程”学科,通过整合1400余篇论文构建“基础组件 - 系统实现”框架。它将上下文定义为动态结构化信息集合,揭示LLMs理解强于生成的矛盾,为AI研究指明方向。
从物竞天择到智能进化,首篇自进化智能体综述的ASI之路
普林斯顿大学等机构研究者发布首个自进化智能体综述,为领域建统一理论框架和路线图。综述给出形式化定义,围绕What、When、How、Where构建分析设计框架,还探讨评估范式并指明未来方向。
使用 GPT-5 进行编程的六个技巧
OpenAI给出使用GPT - 5编程的6个提示技巧,如指令准确无冲突、选对推理力度、用类XML语法结构化规则等,还提供了详细提示技巧的参考链接。
金融版 Claude Code
Dexter 是自主运行的金融研究智能体,类似金融版 Claude Code。能处理复杂金融问题,有智能任务规划等核心能力。文章介绍其先决条件、安装、运行、评估、调试方法及项目地址。
The Batch: 894 | 面向生物医学的多模态模型
过去几年联合推理模型进展快,但生物医学领域能力碎片化、脆弱或难解释。2026 年,学术界应推进多模态模型建设,关注深度整合、可解释性、数据效率和适应性及模型在工作流中的整合。
5.8k Star 基于LangGraph的Multi-Agents炒股框架,7种Agent形成金融交易闭环
TradingAgents是模拟真实交易公司运作的多智能体交易框架,用LangGraph构建,有灵活性与模块化特点。由7种LLM驱动的专业智能体协同评估市场、制定决策,还介绍了架构和实战操作。
从需求分析到代码生成,LLM都能干点啥?一文读懂291个软工Benchmark!
大语言模型重塑软件工程各环节,但缺乏评估其在该领域表现的系统工具。浙江大学等机构团队首次对291个软件工程Benchmark系统综述,分析现状、痛点并给出改进方向。