「Transformer架构」共找到 1965 篇相关文章
AI终于学会「读懂人心」,带飞DeepSeek R1,OpenAI o3等模型
威斯康星大学麦迪逊分校联合清华的研究《MetaMind: Modeling Human Social Thoughts with Metacognitive Multi-Agent Systems》,将元认知理论融入LLM架构,使模型在心智理论测试达人类平均水平,揭示构建社交智能AI方法论。
硅光,到底是个啥?
硅光是光通信热门概念,被认为是光通信未来。文章介绍其定义、光模块架构原理、优点及应用场景,指出虽有短板和产业标准化问题,但前景广阔,国内企业也在加速追赶。
Couchbase与爱奇艺的十年之约:Magma引擎如何破解TB级缓存性能与成本难题?
在AI驱动应用革新浪潮下,海量数据处理的性能与成本平衡成挑战。Couchbase技术直播中,爱奇艺专家分享实践经验,揭秘其如何破解性能、扩展性与成本难题,还介绍了Capella AI Services等。
Uber&WisdomAI揭露95%AI Agent落地失败的真相 !
在‘Beyond the Prompt’技术论坛上,Uber、WisdomAI等企业揭开AI智能体落地难症结。指出90%失败源于‘喂错料’,信任是落地‘生死线’,记忆是架构设计,多模型编排与场景化交互决定用户体验上限。
《AI大模型与异构算力融合技术白皮书》正式发布
10月10日,中科算网等联合发布《AI大模型与异构算力融合技术白皮书》,聚焦大模型开发痛点,为开发者提供技术参考。白皮书介绍全球大模型发展概况、应用场景拓展、算力需求与挑战,指出异构算力成主流趋势。
谁是2025年度最好的编程语言?
在2025年IEEE Spectrum编程语言排行榜上,Python十连冠且成三冠王,与第二名差距大,还借AI放大优势。JavaScript排名波动大,SQL宝座被冲击。同时,编程社区文化衰落,AI或终结编程语言多样性。
不靠英伟达,中科院在国产 GPU 上跑通 76B 类脑大模型
过去大模型依赖Transformer和NVIDIA GPU体系,硬件自主化难。中科院团队提出类脑大模型SpikingBrain,在超长文本处理上百倍加速,在国产MetaX GPU平台稳定训练76B模型,开辟新道路。
详解Github 35K+项目:打通200+数据源,构建企业级AI的数据统一入口,支持MCP【上篇】
文章实测开源的AI数据统一访问引擎MindsDB,介绍其架构、安装启动方法,展示跨多数据源统一查询、AI模型赋能数据查询等功能,还将在下篇介绍知识库与智能体特性。
集合通信库VCCL释放GPU极致算力,创智、基流、智谱、联通、北航、清华、东南重磅开源
在超大规模智算集群需求下,创智、基流等多方联合开源集合通信库VCCL。它基于NCCL开发,有智能调度、容错、细粒度观测机制,实测能提升算力利用率、降低故障率,还解决了服务器异构等问题。
LM Studio宣布支持在Mac上跑Qwen3-Next 80B模型
LM Studio宣布支持基于MLX框架在Mac上运行阿里Qwen3-Next 80B模型。该模型虽总参数量达800亿,但每次推理仅激活30亿。第三方评测显示其4bit量化运行效果好,不过实现GGUF格式支持尚需时间。