$npx -y skills add woodfishhhh/EZ_math_model --skill dataset公开数据集发现入口。覆盖 Kaggle / UCI / HuggingFace / 天池。题目要求"自行 查找数据"或"补充外部数据"时启用;附件已含数据时不调用。
| 1 | # dataset — 公开数据集发现 |
| 2 | |
| 3 | ## 何时使用 |
| 4 | |
| 5 | - 题目附件**没有**数据集,但题面要求"查找类似公开数据"。 |
| 6 | - 需要历史基准数据集(如 MNIST / Iris / 波士顿房价)做模型对比。 |
| 7 | - **不要**在已有附件数据时启用本子 skill。 |
| 8 | |
| 9 | ## 入口 |
| 10 | |
| 11 | | 数据源 | 入口 | 配置 | |
| 12 | |---|---|---| |
| 13 | | Kaggle | `kaggle datasets list -s <kw>` / `kaggle datasets download -d <user/name>` | `~/.kaggle/kaggle.json`(注册免费下载) | |
| 14 | | UCI ML | 直接 HTTPS `pd.read_csv(url)` | 无 | |
| 15 | | HuggingFace | `from datasets import load_dataset` | `EZMM_HF_TOKEN`(私有数据集) | |
| 16 | | 天池 | 浏览器 + 手动下载 | 无 | |
| 17 | |
| 18 | ## 命令模板 |
| 19 | |
| 20 | ```powershell |
| 21 | # Kaggle 搜索 + 下载 |
| 22 | kaggle datasets list -s "vegetable retail price" |
| 23 | kaggle datasets download -d <user/dataset-name> -p workdir/.../attachments/external/kaggle --unzip |
| 24 | |
| 25 | # HuggingFace |
| 26 | python -c "from datasets import load_dataset; ds = load_dataset('squad', split='train[:1%]')" |
| 27 | |
| 28 | # UCI(直接 URL) |
| 29 | python -c "import pandas as pd; df = pd.read_csv('https://archive.ics.uci.edu/...'); df.to_csv('workdir/.../attachments/external/uci/iris.csv', index=False)" |
| 30 | ``` |
| 31 | |
| 32 | ## 落盘规范 |
| 33 | |
| 34 | 外部下载的数据放在: |
| 35 | |
| 36 | ``` |
| 37 | workdir/{task_id}/attachments/external/<source>/<dataset>/ |
| 38 | ``` |
| 39 | |
| 40 | 并在同目录写 `SOURCES.md`: |
| 41 | |
| 42 | ```markdown |
| 43 | - 数据集名: <name> |
| 44 | - 来源: <kaggle url> |
| 45 | - License: <CC0 / CC-BY / Apache-2.0 / 其他> |
| 46 | - 下载时间: <ISO timestamp> |
| 47 | - 用途说明: <一句话> |
| 48 | ``` |
| 49 | |
| 50 | ## 失败诊断 |
| 51 | |
| 52 | | 情况 | 处理 | |
| 53 | |---|---| |
| 54 | | Kaggle token 未配置 | 提示用户 `~/.kaggle/kaggle.json` 配置 | |
| 55 | | License 不允许商用 | 数据可用于学术建模报告;论文中标明出处 + license | |
| 56 | | 文件 > 1GB | coder 阶段用 chunksize 处理(参考 `prompts/coder.md`) | |
| 57 | | 网络受限 | 写诊断;建议用户手动下载放入 attachments/ | |