「模型架构」共找到 8678 篇相关文章
90后清华博士厨房机器人融资数千万,拿下北京市首张具身智能机器人食品经营许可证
享刻智能官宣完成数千万元Pre - A轮融资,创始人陈震是连续创业者。其LAVA厨房机器人获北京市首张具身智能机器人食品经营许可证,已签千台级订单,还将围绕‘三机一体’架构升级技术。
苹果出手!改进GRPO,让dLLM也能高效强化学习
苹果研究团队针对扩散语言模型(dLLM)在编码任务中表现不明的问题,基于7B级代码生成MDM DiffuCoder展开研究,定制优化GRPO提出coupled - GRPO算法,填补开源dLLM训练和推理机制空白。
成立 5 年最高估值超百亿,摩尔线程之后,又一家AI芯片独角兽争当“国产 GPU 第一股”
6月23日,沐曦集成电路IPO辅导完成,离A股上市更近一步。它成立于2020年,专注高性能GPU,产品应用广,还与书生・浦语3.0合作。虽曾被曝裁员,但已完成8轮融资。当下国产GPU厂商扎堆IPO,适配DeepSeek或带来机遇。
孙凝晖院士:集成芯片带来三大科学问题
随着摩尔定律发展放缓,集成芯片与芯粒技术对高性能芯片设计制造愈发重要。孙凝晖院士在2025年度晶上系统生态大会指出,集成芯片是提升性能新路径,但芯粒集成度提升带来三大科学问题。
ICML 2025 | 千倍长度泛化!蚂蚁新注意力机制GCA实现16M长上下文精准理解
在大语言模型发展中,长文本建模挑战大。蚂蚁研究团队提出注意力机制GCA,可端到端学习检索相关片段,实现超长序列处理与泛化,其Triton kernel实现已开源,论文被ICML 2025接收。
“看懂”指令并做动作!Motion-R1结合COT让角色动起来
大语言模型为文本驱动动作生成带来新可能,但现有方法有局限。GigaAI提出Motion - R1框架,融合“思维链”机制,能分解指令、优化动作合成,虽有不足,但在测试中表现优于主流方法。
搜索Agent最新高效推理框架:吞吐量翻3倍、延迟降至1/5,还不牺牲答案质量丨南开& UIUC研究
大语言模型驱动的搜索智能体有能力但效率低。南开和UIUC研究人员剖析效率瓶颈,提出SearchAgent-X框架,实现吞吐量提升、延迟降低,且不牺牲答案质量,还揭示AI智能体平衡和等待问题。
Anthropic CEO:人的幻觉比AI 更多!这是真的吗?
Anthropic公司CEO称AI幻觉比人类少,创业公司ColdIQ联合创始人Alex Vacca用虚构故事喂给ChatGPT、Claude和Gemini,测试它们识破谎言的能力,实验结果显示各模型表现不同,AI幻觉短期内难消失。
Claude 4被诱导窃取个人隐私!GitHub官方MCP服务器安全漏洞曝光
瑞士网络安全公司发现,GitHub官方MCP服务器面临新型攻击,可诱导AI Agent将私有仓库敏感数据泄露至公共仓库。GitLab Duo近期也有类似漏洞。公司还提出初步缓解举措。
这些关于研发提效的深度实践,值得每一位开发者关注 | AICon
6月27 - 28日AICon北京站上,一线大厂技术大牛将分享“AI赋能研发提效”经验,涉及AI编程范式革新、代码智能化落地、研发流程优化等多方面,呈现技术演进与落地路径。