「西工大」共找到 5051 篇相关文章
MiniMax-M1:全球首个开源超长上下文大模型,超越DeepSeek-R1,推理成本仅1/4
MiniMax-M1是全球首个开源超长上下文大模型,刷新三项记录。它采用混合专家架构,闪电注意力让推理复杂度近乎线性增长。CISPO算法加速训练,成本低。在工业级任务测试表现佳,已开源且方便开发者接入。
大模型API的大众点评来了:7×24小时实测,毫秒级延迟智能路由,选API必备
清程极智推出的AI Ping像大模型API领域的大众点评,用7×24小时实测数据为开发者提供参考,解决信息差和重复劳动问题。它有持续评测榜单、智能路由匹配等功能,还统一了API度量衡,推动选型从经验走向数据驱动。
科技赋能艺术 让多样文明在数字时代华彩绽放 |国家大剧院受邀参加第二十四届中国上海国际艺术节
国家大剧院院长王宁在第二十四届中国上海国际艺术节演讲,阐述艺术与科技融合内涵,指出科技为艺术注入动能、艺术推动技术迭代、二者融合构建文化共享模式,还提出四点倡议促发展。
我用大模型砌“屎山雕花”:5天肝出几万行代码!产品经理的AI编程翻车记
作者作为非技术背景的产品经理,分享用大模型编程经历。先借 MCP 搭建应用,后 5 天产出大量代码却问题多。经三次重构领悟协作方法,还总结沟通技巧,指出 AI 编程改变产品经理工作,未来需融合多角色能力。
Agent 不是渐进升级,而是要“换代”了:Cursor 工程负责人放话未来三到六个月,行业将迎来大变局
本文是对Cursor工程负责人Jason Ginsberg的访谈。他认为编码Agent正换代,未来三到六个月行业将大变,会接管复杂任务。还谈及编码Agent发展、Cursor使用方式、交互模式等,分享了产品开发、审查等看法。
小红书hi lab首次开源文本大模型,训练资源不到Qwen2.5 72B 的四分之一
6月6日,小红书hi lab团队首次开源文本大模型dots.llm1,采用MIT许可证。该模型激活参数量140亿,总参数量1420亿,上下文长度32K。训练资源不到Qwen2.5 72B的四分之一,在多个测评中表现出色。
2026“企业 Agent 上岗元年”?零一万物六大判断定义企业多智能体,不再沿用大厂标准化产品模式”
1月5日,零一万物发布《中国企业智能体2026六大预判》,展示“万智2.5企业多智能体”。基于实践总结六大核心预判,还升级万智平台,不沿用大厂标准化模式,规划企业多智能体进化“三步走”布局。
大模型解数学题是真懂还是 “死记硬背”?|首个反例驱动的数学推理基准揭穿 “刷题式假象”!
随着大语言模型在数学领域应用渐广,其是否真具备数学推理能力成焦点。清华等团队提出反例推理评测基准COUNTERMATH,测试20+主流模型,结果不佳,而小样本微调能显著提升模型能力。
AI还不会独自问诊,o3准确率仅为51.12%,上交大×SII开源高难度复杂疾病诊断测评集
上海交大与SII团队开源高难度复杂疾病诊断测评集DiagnosisArena。测试显示,现有大模型在复杂临床诊断任务中表现不佳,o3准确率仅51.12%,且选择题设置无法反映其真实能力。
训练提速4.6倍!FP4+BF16双轨并行,NVIDIA×港大×MIT联手重新定义扩散模型训练速度上限
NVIDIA、港大、MIT团队提出Sol - RL,采用「FP4先探索、BF16再训练」框架,将扩散模型训练收敛速度最高提至4.64x,在速度与对齐效果间给出工程可行解法。