「GPT架构」共找到 2769 篇相关文章
英伟达咽喉上的苏州人
英伟达供应链名单中,英诺赛科意外现身。它从珠海‘三无小作坊’起步,7年吸金60亿,成英伟达中国独家供应商。创始人骆薇薇回国创业,选IDM模式和8英寸工艺,带领公司成全球首量产8英寸硅基氮化镓晶圆企业。
EMNLP2025 | 揭开LLM训练数据中的中文污染真相,有比“您好”高2.6倍的token?
近年来,大型语言模型虽成功,但训练数据易混入不良内容。论文《Speculating LLMs' Chinese Training Data Pollution from Their Tokens》探索此问题,定义PoC Token,开发PoCDetect和PoCTrace工具,揭示LLMs训练数据污染情况。
Crossplane 2.0 发布:在云基础设施之上全面支持应用管理
Crossplane 开源项目发布 2.0 版本,将管理范围从云基础设施拓展到应用与基础设施协同编排。解决了基础设施与应用需分开管理的问题,新增应用支持,改进组合资源,采用命名空间优先设计,还引入新 Operation 类型。
耶鲁等团队联合发布首个虚拟细胞Agent,可自动设计出先进的模型
耶鲁等团队发布首个多智能体系统CellForge,可自动化设计虚拟细胞模型。它能输出模型架构和代码,有跨模态能力,性能超多个领域代表性模型,可降低科研门槛,加速药物研发。
扎克伯格看OpenAI直播挖人,北大校友孙之清加入Meta
本周五,前OpenAI研究科学家Hyung Won Chung晒照,显示他、孙之清与Jason Wei已加入Meta新成立的超级智能实验室。孙之清曾是ChatGPT Agent核心开发者,还和山姆・奥特曼直播发布该产品,一个月后跳槽。
隐藏超多上下文工程(Context Engineering)技巧的框架,来试一试吧!
文章指出多数人构建的AI Agent像Shallow Agent,处理复杂任务能力弱。以Claude Code等为例,介绍深度Agent架构的秘密,如冗长提示词、规划工具等,还推出开源包deepagents方便上手。
从OpenAI离职创业到估值1700亿美元,Anthropic用4年时间引硅谷巨头疯狂押注
最新消息,Claude背后公司Anthropic即将达成新一轮融资50亿美元,总估值达1700亿,不到半年估值涨近3倍。该公司由前OpenAI员工创立,获亚马逊、谷歌等投资,其模型在代码生成领域优势明显。
全能高手&科学明星,上海AI实验室开源发布『书生』科学多模态大模型Intern-S1 | WAIC 2025
7月26日,上海AI实验室在WAIC 2025上发布并开源『书生』科学多模态大模型Intern-S1。它首创‘跨模态科学解析引擎’,在多学科专业任务上超越顶尖闭源模型,多模态综合能力领先主流开源模型。
重塑注意力机制:GTA登场,KV缓存缩减70%、计算量削减62.5%
GTA由多所高校联合研发,提出大模型框架,解决传统多头注意力机制弊端。通过分组共享注意力矩阵和压缩潜在值表示,削减计算量、缩减KV缓存,实验验证其性能优、效率高,虽有局限但前景好。
本周推荐的6个超级6的Github开源项目!
本文推荐6个超棒的Github开源项目。有强大的数据可视化工具Perspective;能“隐身”的AI桌面助手Glass;性能超GPT - 4o、Gemini的轻量国产OCR项目MonkeyOCR等,各有特色与优势。