Appearance
實驗紀錄
快速體驗(CPU/MacBook)
bash
# 安裝相依套件
uv sync --extra cpu
source .venv/bin/activate
# 訓練極小型模型(僅數分鐘)
python -m scripts.base_train --depth=4 --max-seq-len=512 --device-batch-size=1 --eval-tokens=512 --core-metric-every=-1 --total-batch-size=512 --num-iterations=20GPT-2 Speedrun(8×H100)
bash
bash runs/speedrun.sh # ~3 小時完成後啟動聊天 UI:
bash
python -m scripts.chat_web造訪 http://<IP>:8000/ 即可與模型對話。
Scaling Laws 實驗
bash
bash runs/scaling_laws.sh # 掃描多個 depth 的 scaling 行為
bash runs/miniseries.sh # 訓練一系列 compute-optimal 模型快速迭代(~5 分鐘)
bash
OMP_NUM_THREADS=1 torchrun --standalone --nproc_per_node=8 -m scripts.base_train -- \
--depth=12 --run="d12" --model-tag="d12" --core-metric-every=999999 \
--sample-every=-1 --save-every=-1監控 wandb 的 val_bpb、core_metric、train/mfu 判斷改進效果。
硬體需求
| 設定 | GPU | VRAM | 時間 | 費用 |
|---|---|---|---|---|
| GPT-2 speedrun | 8×H100 | 80GB | ~2-3 hr | ~$48 |
| 單卡 H100 | 1×H100 | 80GB | ~16-24 hr | ~$48 |
| 單卡 A100 | 1×A100 | 80GB | ~24-36 hr | ~$36 |
| CPU 體驗版 | CPU/Mac | N/A | ~10 min | 免費 |
監控指標
val_bpb:驗證損失(bits per byte),越低越好core_metric:DCLM CORE 分數,越高越好(GPT-2 = 0.256525)train/mfu:GPU 利用率,越高越好(理想 ~50%+)train/tok_per_sec:訓練吞吐量