该来源采用摘要模式,本站展示内容摘要,请前往原站阅读全文。
本文也提供英文版本 English。 在 「PyTorch 性能剖析 (profiling)」系列的第一部分 中,我们用 torch.add(torch.matmul(x, w), b) 学习了如何阅读 PyTorch 性能剖析器轨迹。沿途还讨论了几个相关主题:CPU 调度链、启动开销、开销受限与计算受限两种状态的区别,以及 torch.compile 的一些内部机制。 到了第二篇(也就是本文),我们再向上迈一步。我们会把手写的矩阵乘加组合替换为 nn.Linear(设置 bias=True)。这是每个深度学习模型都会用到的基础构件。随后,我们会把三个 nn.Linear(本例中的具体设置)堆叠起来,并在中间加入激活函数,构成一个多
本文也提供英文版本 English。 无法进行性能剖析( profiling ),就无法优化。 无法进行性能剖析( profiling ),就无法优化。 无论目标是让大语言模型(LLM)每秒生成更多词元(token)、把推理耗时缩短几毫秒,还是弄清楚训练循环为什么比规格表承诺的速度慢,最终都绕不开性能剖析。 难点在于,性能剖析的入门门槛很高。性能轨迹像一面密密麻麻的彩色矩形墙,各类事件名称也常常让人望而生畏。大多数教程默认读者已经知道如何阅读轨迹。因此,即便已经知道应该做性能剖析,打开一份轨迹也常常像是一件可以留到以后、或交给别人处理的麻烦事。本文以及这个系列,正是为了降低这道门槛。 本文是《PyTorch 性能剖析》系列的开篇文章
本文也提供英文版本 English。 继我们使用 Claude Code 训练开源模型的项目之后,现在我们更进一步,将 Codex 引入这一流程。这里的重点不是“Codex 自己开源模型”,而是让 Codex 作为编码代理,参与并自动化开源模型的训练、评估与发布全流程。为此,我们为 Codex 接入了 Hugging Face Skills 仓库,该仓库包含了许多与机器学习和 AI 相关的“技能”,比如模型训练与评估等任务。通过 HF Skills,Codex 这样的编码代理可以实现: 对语言模型进行微调和强化学习(RL)对齐训练 查看、解释并基于 Trackio 的实时训练指标做出操作 评估模型检查点并根据评估结果作出决策 生成实
本文也提供英文版本 English。 Hugging Face 的 Jeff Boudier 表示: “Google 一直是开放式 AI 领域的重要推动者——从最初的 Transformer 到如今的 Gemma 模型。 我相信未来每一家企业都将能构建并定制属于自己的 AI。通过这次战略合作,我们让这一切在 Google Cloud 上变得更加简单。” Google Cloud 产品管理高级总监 Ryan J. Salva 表示: “Hugging Face 是推动全球大中小企业访问、使用并定制超过 200 万个开源模型的核心力量,我们也自豪地为社区贡献了超过 1000 个模型。” “携手合作,我们将让 Google Cloud 成
本文也提供英文版本 English。 摘要 一篇实用指南,手把手教你如何采集数据、训练策略,并将自动化医疗机器人工作流程部署到真实硬件上。 目录 使用 NVIDIA Isaac 构建医疗机器人:从仿真到部署 摘要 目录 简介 SO-ARM 入门工作流:构建一台手术辅助机器人 技术实现 仿真与现实结合的训练方法 硬件要求 数据采集实现 仿真遥操作控制 模型训练流程 完整的仿真采集-训练-评估流程 在仿真中生成合成数据 训练和评估策略 将模型转换为 TensorRT 快速开始 资源链接 使用 NVIDIA Isaac 构建医疗机器人:从仿真到部署 摘要 摘要 目录 目录 简介 简介 SO-ARM 入门工作流:构建一台手术辅助机器人 技术
本文也提供英文版本 English。 近年来,逼真的语音生成技术已经达到了令人惊讶的水平。在某些情况下,生成出来的合成语音几乎能以假乱真,和真人的声音非常相似。如今,曾经只存在于科幻小说中的“语音克隆”已经成为现实。只需要几秒钟的录音,就能让任何人的声音“说出”任何内容。 语音生成,尤其是语音克隆技术,既有风险也有益处。它可能被用于制作“深度伪造”内容,例如 有人用前总统 Biden 的克隆语音进行自动电话宣传,误导公众以为他说过其实并未说的话。但与此同时,语音克隆也可以带来积极作用,比如 帮助失语者 重新用自己的声音表达,或者辅助人们学习语言和方言。 那么,我们该如何实现“有意义的使用”而不是“恶意的滥用”?我们正在探索一种可能的
本文也提供英文版本 English。 快速了解(TLDR) 现在只需一行代码,就能通过 load_dataset('dataset', streaming=True) 以流式方式加载数据集,无需下载! 无需复杂配置、不占磁盘空间、不再担心 “磁盘已满” 或 429 请求过多错误,立即开始训练 TB 级数据集! 性能非常强劲:在 64×H100、256 个并发 worker 环境下,流式加载速度甚至超过本地 SSD! 我们优化后的流式系统:请求数减少 100 倍 → 数据解析速度提升 10 倍 → 样本处理速度翻倍 → 即使在 256 个并发 worker 下也 0 崩溃。 现在只需一行代码,就能通过 load_dataset('da
本文也提供英文版本 English。 🚀 强烈建议尽快升级至 v1.0,以体验更优性能和全新功能。 pip install --upgrade huggingface_hub 此次重大版本更新包括以下内容: 使用 httpx 作为新后端请求库; 全新设计的 hf 命令行工具(取代已弃用的 huggingface-cli),采用 Typer 构建,功能更加丰富; 文件传输全面迁移至 hf_xet,彻底淘汰旧的 hf_transfer 工具。 查看完整的 v1.0 发布说明 我们尽可能确保 v1.0.0 与旧版本兼容。大多数机器学习库无需修改即可兼容 v0.x 和 v1.x。主要例外是 transformers:v4 版本依赖 v0.x
本文也提供英文版本 English。 简要总结 LeRobot v0.4.0 为开源机器人领域带来重要升级:引入可扩展的 Datasets v3.0、强大的新 VLA(视觉-语言-动作)模型如 PI0.5 与 GR00T N1.5,以及全新的插件系统,简化硬件集成。该版本还新增对 LIBERO 与 Meta-World 仿真的支持、简化多 GPU 训练,并上线全新的 Hugging Face 机器人学习课程。 目录 [LeRobot v0.4.0:全面提升开源机器人的学习能力](#LeRobot v0.4.0:全面提升开源机器人的学习能力) 简要总结 数据集:为下一波大规模机器人学习做好准备 Datasets v3.0 有何新变化?
本文也提供英文版本 English。 [!提示] 我们在这篇文章中新增了 Chandra 和 OlmOCR-2,并附上了它们在 OlmOCR 基准上的得分 🫡 摘要: 强大的视觉语言模型(Vision-Language Models, VLMs)的崛起,正在彻底改变文档智能(Document AI)的格局。每种模型都有其独特的优势,因此选择合适的模型变得棘手。相比闭源模型,开源权重的模型在成本效率和隐私保护上更具优势。为了帮助你快速上手,我们整理了这份指南。 在本指南中,你将了解到: 当前 OCR 模型的整体格局及其能力 何时需要微调模型,何时可直接使用 为你的场景选择合适模型时应考虑的关键因素 如何超越传统 OCR,探索多模态检索
本文也提供英文版本 English。 🧭简要概览:Hugging Face AI Sheets 是一款开源工具,能够用 AI 模型增强数据集的处理能力,无需编写任何代码。现在新增视觉功能:可以从图像(如收据、文档)中提取数据、根据文本生成图像、甚至编辑图片——一切都能在电子表格中完成。依托 Inference Providers,可调用数千个开放模型。 我们非常高兴地发布 Hugging Face AI Sheets 的重大更新版——这是一款可通过开放 AI 模型构建、转换与丰富数据的开源工具。AI Sheets 基于 Inference Providers 运行,意味着你可以使用由全球顶级推理服务驱动的数千种开放模型。 AI Sh
本文也提供英文版本 English。 在这篇博客文章中,我们将深入讨论了所有的升级,以及它们如何成为transformers工具包的一部分,以便其他模型(当前和未来的)能够从中受益。提供 Transformers 中新方法的简洁实现,也有助于社区快速理解和采用它们。像MLX、llama.cpp或vLLM这样的框架可以直接使用transformers代码作为参考来构建自己的应用。 对于这次发布,我们致力于: 零构建内核,可从Hub下载 MXFP4量化 张量并行 专家并行 动态滑动窗口层和缓存 连续批处理和分页注意力 更快地加载更大的模型 最棒的部分:这些功能中的大多数应该适用于transformers内的所有主要模型! 最棒的部分:这
本文也提供英文版本 English。 生成图像或视频可能需要相当多的时间。在这种情况下,充分利用 H200 硬件,使其发挥极致性能就显得尤为重要。 这就是 PyTorch 提前编译(AoT)的用武之地。与其在运行时动态编译模型(这和 ZeroGPU 短生命周期的进程配合得并不好),提前编译允许你一次优化、随时快速加载。 结果:演示更流畅、体验更顺滑,在 Flux、Wan 和 LTX 等模型上带来 1.3×–1.8× 的提速 🔥 在这篇文章中,我们将展示如何在 ZeroGPU Spaces 中接入提前编译(AoT)。我们会探索一些高级技巧,如 FP8 量化和动态形状,并分享你可以立即尝试的可运行演示。如果你想尽快尝试,可以先去 zer
本文也提供英文版本 English。 TL;DR: 通过将 Claude 连接到 Hugging Face Spaces,现在可以比以往更轻松地使用最先进的 AI 模型生成细节丰富的图像。本文介绍具体方法和原因,并介绍近期发布的几款模型:它们擅长生成自然图像,或生成包含文本的图像。 2025 年 10 月更新:Anthropic 更新 Connector Directory Policy 后,需要使用「Add custom connector」选项,并将 Remote MCP server URL 设置为 https://huggingface.co/mcp?login,才能在 Claude 中使用图像生成和其他 Gradio Sp
已加载全部资讯