「通义大模型」共找到 9226 篇相关文章
150%训练效率提升:感知检测小模型训练优化方法
文章基于业务实践,总结感知检测小模型在不同算力卡上的训练方法,为智能驾驶场景提供借鉴。介绍测试环境、技术架构,分析环境依赖冲突、源代码适配等问题并给出解决方法,还提及性能优化及测试结果。此外还介绍用 RAGFlow 构建私有知识问答应用。
大厂离职后,白天是保安,夜里是 AI 创造者
本文讲述杨晨从大厂运营离职后成为保安,白天观察人间百态,夜里用AI搞创作。他用AI为家人、朋友做工具,还帮公司做定制化工作流,赚了点小钱。他也想记录普通人故事,认为大家可借AI改变生活。
刚刚!Meta把大模型塞进脑机接口,隔空读脑直逼开颅植入水平,代码全开源
Meta推出Brain2Qwerty v2,号称性能最强端到端方案,能基于非侵入式脑部记录实现实时句子级解码,准确率逼近开颅手术水平。还开源代码,公开数据集,旨在帮脑损伤患者交流。
AI 终于能"玩手机"了:Mobile MCP 让大模型直接操控你的 iOS 和 Android
Mobile MCP 是开源 MCP Server,让支持 MCP 协议的 AI 客户端操控 iOS 和 Android 设备,通过自然语言指令完成操作,解锁自动化测试等场景,但成功率有待提升,目前更适合探索性测试等。
拥抱大模型:深入剖析ReAct的核心原理、技术架构及其对AI领域的深远影响
文章深入剖析ReAct,它是普林斯顿大学和谷歌团队提出的智能体架构范式,将推理与行动协同,构建TAO闭环。介绍其原理、架构,指出解决传统AI难题,也存在局限,未来可与强化学习等融合。
NeurIPS 2025 | Code Graph Model:重塑代码大模型架构,利用“代码图”突破仓库级编程瓶颈
在 NeurIPS 2025 上,蚂蚁全模态代码算法团队展示「Code Graph Model (CGM)」,它将代码库图结构注入 LLM 底层注意力机制,打破业界刻板印象,在权威榜单上表现出色。文章解析其架构、训练策略和配套框架。
MeshCoder:以大语言模型驱动,从点云到可编辑结构化物体代码的革新
生成式AI在三维空间面临挑战,传统3D生成成果粗糙难编辑。团队推出MeshCoder,将三维输入翻译成结构化代码,有分部件生成等优势。介绍其实现路径、实验性能,也指出局限并展望未来。
总成本降低30倍,告别昂贵后训练,在线策略蒸馏敲开大模型后训练的未来
明星公司Thinking Machines由前OpenAI首席技术官联合创立,其研究团队提出在线策略蒸馏的LLM后训练方法。该方法结合在线策略训练与蒸馏优势,解决后训练两难困境,成本降30倍,还为持续学习和个性化打开新大门。
大模型“精细化”对齐,真实性提升25.8%刷新SOTA!token级精准编辑,无需训练即插即用
北航团队在EMNLP 2025提出Token - Aware Editing (TAE)方法,从token层面解决传统表征编辑技术问题,无需训练、即插即用,在多个对齐维度显著提升,如在TruthfulQA任务上真实性指标提升25.8%。
重磅!Thinking Machines开山之作:大模型输出随机的根本原因被揪出,并开源终结方案
由OpenAI前CTO创办的Thinking Machines宣布上线技术研究博客,开篇文章揪出LLM输出随机的根本原因是负载及批次大小的非确定性变化,并给出系统性解法,还开源方案。