港科大(广州)」共找到 5083 篇相关文章

8

刚刚,DeepSeek扔出杀器,梁文锋署名!暴力优化AI架构

2026新年第一天,DeepSeek发表梁文锋署名新论文,提出「mHC(流形约束超连接)」架构。它仅增约6.7%训练时间开销,就能让27B参数模型性能显著提升,还可能淘汰ResNet结构。

力学与人工智能
开源动态7

模型到多模态,图文混排Agent彻底起飞~

上周智谱多模态开源周,从GLM 4.6v到Autoglm,其图文并排使用场景很吸睛。上传PDF论文,它能生成图文混排解读文章,效果好。作者逆向原理复刻代码,还分享GLM 4.6V三个有意思的能力。

探索AGI
算法论文8

准确率腰斩!模型视觉能力一出日常生活就「失灵」

EgoCross项目团队聚焦跨域第一视角视频问答评测,揭示现有MLLM在多场景泛化瓶颈。团队提出跨域第一视角视频问答基准EgoCross,经测试揭示模型短板,验证改进方法潜力,研究入选AAAI 2026且数据集等已开源。

量子位
开源动态8

小米打通智驾和具身模型,然后开源了

小米汽车陈龙团队开源全球首个跨具身基座模型MiMo - Embodied,基于MiMo - VL架构,采用四阶段训练策略,打破室内操作与户外驾驶领域鸿沟,在29个Benchmark上超现有模型。

量子位
7

AI Coding正在重塑前端!一码多端如何破局?

InfoQ直播栏目邀前阿里工程师吴子奇等探讨AI Coding与跨端研发。提到跨端框架设计、技术创新、人才要求等观点,还介绍快手和字节探索,10月QCon上海站设相关专题。

InfoQ
算法论文8

突破!实验证明,RL能为LLM注入“创新”能力

此研究挑战‘RL不教新技能’观点,通过‘字符串转换预测’实验证明,RL能让LLM学会组合已有原子技能,形成可泛化、迁移的元技能,还给出模型能力提升路径。

深度学习自然语言处理
产品应用8

字节发了个机器人全能模型,带队人李航

字节推出Seed,其Robix视觉—语言单模型能搞定机器人推理、任务规划和自然语言交互,核心采用思维链推理和三阶段训练策略,效果超Qwen2.5 - VL、GPT - 4o等,负责人是李航。

量子位
开源动态8

冲上热搜!美团模型,靠「快」火了

国内外开发者亲测,美团新开源的LongCat - Flash - Chat模型速度超快,推理速度超每秒100个token。它来自美团LongCat - Flash系列,官网可直接用。该模型架构创新,训练方法高效,还做了专属和系统级优化,跑起来又快又便宜。

机器之心
开源动态7

开源模型实战:GPT-OSS本地部署与全面测评

2025年8月5日,OpenAI发布GPT-OSS-120B和GPT-OSS-20B开放轻量级语言模型,采用Apache 2.0开源许可证。文章介绍通过Ollama本地部署GPT-OSS -20B模型的方法,并对其进行AI幻觉、算法、SQL、数学题等测试。

机器学习AI算法工程
推荐文章7

相信模型成本会下降,才是业内最的幻觉

很多AI创业者认为模型降价能降成本、改善营收。但文章指出,成本下降仅针对老旧模型,最好模型成本致相同,且模型token消耗激增。还探讨了AI创业商业模式,如按使用量计费、建立高切换成本、垂直整合等。

Founder Park