.fyi
SkillsMCPPluginsSubagents

Browse by category

DevOps & CI/CD SkillsProductivity & Workflow SkillsOther SkillsProduct & Project Management SkillsDocumentation & Knowledge SkillsCode Review & Refactor SkillsBackend & APIs SkillsAgent Meta & Communication SkillsResearch SkillsSecurity SkillsUX UI & Design SkillsTesting & QA SkillsSee all →

Every Claude Code skill, MCP server, plugin and subagent in one directory. Searchable, comparable, and one command from installed. Live stats from GitHub, npm and PyPI.

We're on Product HuntYour agent's app storeCheck it out →
Agent SkillsMCP ServersPluginsSubagentsCoding Agents
CollectionsOfficial publishersGlossaryFAQBlogSearchSavedFeedback
PrivacyTermsllms.txtSitemap

made with ♥ · © 2026 aaaa.fyi

Independent project · real data from public registries

…/ascend-ai-coding/awesome-ascend-skills
home/skills/ascend-ai-coding/awesome-ascend-skills
ascend-ai-coding avatar

ascend-ai-coding/awesome-ascend-skills

58 skills · 72 total installs

View on GitHub
$npx skills add ascend-ai-coding/awesome-ascend-skills
SkillInstalls
skill-creator38create-pr34aiss-tiling-solveranalyse-coverage分析测试覆盖率盲区,生成覆盖率分析报告—ascendc-api-best-practicesascendc-blaze-best-practiceascendc-code-reviewascendc-crash-debugascendc-direct-invoke-templateascendc-docs-searchascendc-env-checkascendc-precision-debugascendc-regbase-best-practiceascendc-runtime-debugascendc-tiling-designAscend C 算子 Tiling 设计指南。提供算子分类体系和 Tiling 核心要素(多核切分、UB切分、Buffer规划、分支覆盖)的详细设计方法。触发:算子设计阶段、设计—model-infer-fusionmodel-infer-graph-modemodel-infer-kvcachemodel-infer-migratormodel-infer-multi-streammodel-infer-parallel-analysismodel-infer-parallel-implmodel-infer-precision-debug基于 PyTorch 框架的昇腾 NPU 模型推理精度问题诊断技能。当前主要覆盖 KVCache / FlashAttention 相关精度问题,包括—model-infer-prefetch基于 PyTorch 框架的昇腾 NPU 模型推理权重预取优化技能。为模型添加 torch_npu.npu_prefetch 特性以优化推理性能。触发场景:profiling—model-infer-runtime-debug基于 PyTorch 框架的昇腾 NPU 模型推理运行时错误诊断与修复技能。系统化排查模型加载、初始化、推理执行全链路的运行时错误,包括—model-infer-superkernel基于 PyTorch 框架的昇腾 NPU 模型推理 SuperKernel 适配技能。当用户需要启用 SuperKernel 算子二进制融合技术优化昇腾—npu-archAscend NPU 架构知识查询技能。通过芯片型号映射、架构代际划分和 archXX 特性说明,帮助判断目标平台能力、特性支持与条件编译策略。当需要确认芯片型号、NpuArch/SocVersion、架构差异、特性支持或编译分支条件时使用。—ops-precision-standard算子精度标准。描述 Ascend C 算子各种 dtype 输出对应的精度比对标准(atol/rtol)。当需要(1)评估算子精度是否达标,(2)编写—ops-profilingNPU 性能采集与分析,用于采集算子性能数据、定位性能瓶颈并给出优化建议。当用户在算子开发过程中提到"上板性能"、"算子性能测试"、"硬件性能验证"、"NPU性能采集"、"NPU—perf-analyzer分析 PyPTO 算子的性能指标。当需要分析PyPTO算子的性能指标,从性能数据文件中提取关键指标,计算性能评级,或提供性能瓶颈分析和优化建议时使用此技能。—pypto-api-explore探索 PyPTO API,为算子开发提供 API 映射、约束检查和 Tiling 需求分析。当需要查找 PyPTO 是否支持某个操作、验证—pypto-golden-generate当需要生成 golden 参考实现时使用此 skill。基于算子规格信息,生成纯 PyTorch golden 参考实现 `{op}_golden.py`,导出—pypto-intent-understandPyPTO 算子需求意图理解。将用户的自然语言算子描述转化为结构化需求文档。当用户描述要开发、实现、创建某个算子时触发,例如:'开发一个—pypto-op-design当需要设计 PyPTO 算子实现方案时使用此 skill。基于算子规格与相关上下文,生成 DESIGN.md(含 API 映射、Tiling—pypto-op-develop当需要编写 PyPTO 算子实现时使用此 skill。基于需求规格、设计方案和参考实现,生成完整可运行的 PyPTO 算子实现与配套测试、文档。Triggers:—pypto-op-perf-tunePyPTO 算子性能分析和自动调优技能。用于对生成及新开发的算子进行性能分析及自动调优,包括算子用例执行及精度校验、性能数据采集及分析、分步骤性能调优和生成性能分析报告。当用户需要分析—pypto-precision-comparePyPTO 算子精度问题调试技能。提供两种精度对比方法:文件保存方法(使用 pypto.pass_verify_save 和 torch.save)和二分对比方法(使用检查点—pypto-precision-debugPyPTO 算子精度问题排查技能。专注于用户代码层面的语法逻辑检查和规避方法尝试。当算子精度验证失败、输出结果异常、计算错误、数值偏差、或任何与精度相关的问题时使用此技能。—tilelang-api-best-practicesTileLang Ascend API 使用最佳实践。提供内存分配、数据搬运、矩阵计算、归约、元素级运算、同步、调度原语等 API 的正确用法和最佳实践。触发:使用—tilelang-op-design根据算子需求生成 TileLang-Ascend 算子设计文档(design.md)。涵盖编程模式选型(Developer/Expert/混合)、API—tilelang-op-developer基于设计文档生成 TileLang-Ascend 算子实现代码与测试。从 design.md 中提取关键信息,结合 examples/ 中的参考实现生成可运行代码。触发:实现算子、写—tilelang-programming-model-guideTileLang Ascend Developer/Expert 模式选择与 pass_configs 配置指南。当需要确定编程模式、配置—tilelang-review检查代码格式是否符合 CI 规则。适用于 TileLang NPU kernel…—torch-ascendc-op-extension将已有 Ascend C <<<>>> 直调工程通过 TORCH_LIBRARY 对接到 PyTorch,实现 torch.ops.npu.xxx()—torch-custom-ops-guide自定义算子入图完整指南。覆盖从零开发、Eager 算子适配 npugraph_ex 图模式(torch.library.custom_op—torch-npugraph-ex-compile-error-diagnosisPyTorch 昇腾 NPU npugraph_ex 编译期报错诊断。覆盖 torch.compile 触发后 TorchDynamo /—torch-npugraph-ex-dfx-triagePyTorch 昇腾 NPU npugraph_ex DFX 问题分诊入口。统一执行首轮全量日志收集与最少闭环信息核对,按报错栈和现象将问题路由到—torch-npugraph-ex-knowledgenpugraph_ex(aclgraph)模式使用指南。采用 Capture & Replay 方式将算子任务下沉至 Device 执行,减少—torch-npugraph-ex-runtime-error-diagnosisPyTorch 昇腾 NPU npugraph_ex 运行时报错诊断。覆盖 ACL graph 已 capture 成功之后,replay—torch-npugraph-ex-templatenpugraph_ex 模式的 MRE(最小可复现示例)代码模板。包含标准 npugraph_ex 编译模板和 npugraph_ex 编译缓存(cache_compile)模板。触发:当用户需要从零生成—triton-latency-optimizer擅长在 Ascend NPU 平台上编写高效 Triton 算子的性能优化专家。 按照严格的顺序逐步优化 Triton 代码,每次只尝试一个优化点,—triton-op-codingTriton Ascend 算子代码生成 Skill — 根据算子任务格式任务描述生成高性能 Triton Ascend 内核代码。支持首次生成和基于错误反馈的迭代优化。—triton-op-designerTriton Ascend 算子算法草图设计 Skill — 根据任务描述设计高质量的算法草图(sketch), 用于指导后续代码生成。支持首次设计和基于历史上下文的迭代优化。—triton-op-verifier算子代码验证 Skill — 按照标准验证流程验证生成的内核代码。 创建验证项目文件,调用 scripts/verify.py 运行验证,验证通过后—triton-task-extractor从用户 PyTorch/Python 代码中提取算子实现,构建为算子任务格式的标准化 任务文件。支持两种模式:单 case(单一自包含—tune-frontendPyPTO 算子开箱性能调优技能。主要关注代码级的调优、前端写法不同导致的性能差异,包括 loop 写法优化、TileShape 设置优化、数据操作优化等。当用户需要进行算子初始开发性能优化、开箱性能调优时使用此技能。触发词:开箱性能调优、代码级优化、loop—tune-incorePyPTO 算子核内性能调优技能。通过分析单 task 的实现指令及 operation,完成核内的性能调优,包括指令级优化、核内流水优化、特殊—tune-swimlanePyPTO 算子深度性能调优技能。通过泳道图分析及调优性能,包括 Stitch 调优、TileShape 深度调优、合图调优、调度策略调优等。当用户需要进行深度性能调优、泳道图分析、Stitch—