「AI 模型」共找到 13680 篇相关文章
DeepSeek开招Harness产品经理!「参与Agent桌面端产品全过程」
DeepSeek热招Agent Harness产品经理,旨在将前沿模型能力转化为领先Agent产品。招聘详情明确职责与任职要求,释放模型和产品两手抓信号,且其融资后有商业化承诺,将加速发展。
CNN: AI 真的会毁掉一半的办公室工作吗?是炒作还是现实
Anthropic的CEO达里奥·阿莫迪称AI或在未来几年消灭一半入门级白领工作,还描绘美好却矛盾的未来。但他无研究数据支撑,说法引发质疑,其警告更像广告而非警示。
谷歌DeepMind「粪坑淘金」全新方法,暗网毒数据也能训出善良模型
谷歌DeepMind研究团队发表论文提出生成式数据精炼(GDR)方法,不直接生成新数据,而是用大模型净化原始数据,保留有用信息。该方法能解决数据枯竭、隐私等问题,实验显示效果良好。
什么!ChatGPT也要刷脸实名认证了?
OpenAI和Anthropic两大AI巨头同时推进身份验证。OpenAI此前已上线年龄预测模型,对开发者和消费端用户进行身份验证;Anthropic 7月8日起更新隐私政策引入身份验证。匿名使用AI的时代或结束。
Cursor滑跪开源技术报告:Kimi基模这样微调能干翻Claude
Cursor放出Composer 2技术报告力证‘自研’,基于Kimi K2.5经持续预训练和异步强化学习,测试表现好。同时,杨植麟分享Kimi团队最新思考,认为大模型要规模化,断言大模型训练进入第三阶段。
AI自我训练?OpenAI研究员Jason Wei泼冷水:它的三大瓶颈你根本想不到
OpenAI研究员Jason Wei认为AI自我完善是未来趋势,但不会‘瞬间爆发’,而是漫长过程。他从三方面阐述,包括自我完善非一蹴而就、不同领域完善难度有差异、科学进步受真实世界实验限制。
DeepSeek-V3再发论文,梁文锋署名,低成本训练大模型的秘密揭开了
DeepSeek 发布围绕 DeepSeek-V3 的技术论文,从硬件架构和模型设计双重视角,探讨实现经济高效的大规模训练和推理的方法。介绍了 DeepSeek-V3 的创新设计,如 DeepSeekMoE 架构、MLA 架构等,还给出未来硬件架构设计建议。
模力工场 028 周 AI 应用榜:AI “身体”觉醒,从工业前线到情感陪伴
模力工场第028周AI应用榜揭晓,上榜应用多来自美国CES展及阿里云通义智能硬件展。AI从虚拟走向物理世界,工业领域机器人成“智能员工”,消费领域有情感陪伴型产品,OiiOii降低动画创作门槛。
“像把大象塞进冰箱一样困难”,端侧大模型是噱头还是未来?
InfoQ《极客有约》X AICon 直播聚焦端侧大模型,探讨其落地挑战与破局思路。专家指出端侧部署有隐私、可用性等优势,但面临内存、精度等难题。华为、支付宝等分享方案,还探讨应用场景、商业模式及未来趋势。
大模型训练的不稳定性有望彻底解决,MIT新研究用谱正则化替代层归一化
MIT团队创造Lipschitz Transformer,用谱正则化替代层归一化,认为或解决训练不稳定根本原因。他们对比多种方法权衡,发现Muon + 奇异值裁剪推动权衡边界,且工作完全开源。