「批不变性」共找到 1344 篇相关文章
真·开外挂!MIT新研究:架构0改动,让大模型解锁千万级上下文
MIT CSAIL团队提出递归语言模型RLM,不改动模型架构,让GPT - 5、Qwen - 3等模型具备千万级token超长文本处理能力。它将上下文处理“外包”,实验显示其处理规模超前沿模型,复杂任务优势显著,多数场景性价比高。
GPT-5被意外泄露,奥特曼宣布即将发布!
一则GPT - 5被意外泄露的消息引发关注,SecureBio的github配置文件中出现相关内容,暗示要把‘推理’提升到新高度。OpenAI CEO等暗示GPT - 5即将发布,但不打算短期内推出有IMO金牌级别数学能力的正式产品。
Karpathy 亲手终结了RAG的草莽时代
Andrej Karpathy分享“LLM Wiki”工作流,将多数Token用于构建“可演化知识库”。此方法不依赖复杂架构,在中等规模数据集上展现出强大能力,引发“LLM Wiki杀死RAG”的讨论,在技术社区和企业级市场反响热烈。
小扎疯狂挖角 OpenAI、签约跳槽就发7亿奖金,奥特曼痛批:不懂创新,老“复制”人了
Meta 首席执行官扎克伯格掀起 AI 人才争夺战,向 OpenAI 和谷歌 DeepMind 员工提供巨额签约奖金。OpenAI 首席执行官奥特曼证实此事,称招聘未成功,还批 Meta 不懂创新,只知“复制”,并透露 OpenAI 未来将推“AI 伴侣”。
Claude Code之父最新判断:AI时代团队分工被重写,这「五种人」最吃香
近日,Anthropic Claude Code 团队负责人 Boris Cherny 提出,随着职能融合,团队传统岗位标签将被 5 类新型角色取代,且成员角色不固定,需随项目变化,此观点引网友热议。
英伟达:RLP 让 AI 在预训练时就学会思考
英伟达研究团队发布 RLP 技术,与传统大语言模型训练不同,它在预训练阶段就让模型学会'先想后说'。通过奖励机制自我监督,实验效果惊人,性能提升显著,不挑数据,打破了大模型训练范式。
61.3%!「人类最后一场考试」AI终于及格了,揭秘Agent自我进化新路径
上海交通大学等联合团队提出MemRL框架,在不微调模型参数下,让AI在“人类最后一场考试”中准确率跃至61.3%。该框架受人类认知科学启发,解耦推理与记忆,实验表现出色,或为AGI提供高效路径。
刚刚,阿里园区被奶茶包围,都是千问点的!西溪叫不动外卖了
2026年1月15日千问App发布会,吴嘉演示用千问点奶茶。千问定位“生活助手”,接入阿里业务,有400余项办事能力,月活破1亿。虽有亮点,但也存在推荐不接地气等问题。
隐私优先的本地匿名化小模型:在数据离开设备前保护个人信息
最强 AI 模型在云端,安全数据在本地,这一矛盾困扰着想用 AI 处理敏感信息的人。Freysa 团队提出解法,不重写提示,只替换敏感信息,用小模型实现精准匿名化,有实用价值。
原来Scaling Law还能被优化?Meta这招省token又提效
2017年《Attention Is All You Need》提出的Transformer是主流语言模型基础范式。Meta新论文提出旋转不变型三线性注意力机制,证明其表现能改变Scaling Law系数,还证实2 - simplicial Transformer在有限token预算下更优。