Skip to content

實驗紀錄

快速體驗(CPU/MacBook)

bash
# 安裝相依套件
uv sync --extra cpu
source .venv/bin/activate

# 訓練極小型模型(僅數分鐘)
python -m scripts.base_train --depth=4 --max-seq-len=512 --device-batch-size=1 --eval-tokens=512 --core-metric-every=-1 --total-batch-size=512 --num-iterations=20

GPT-2 Speedrun(8×H100)

bash
bash runs/speedrun.sh    # ~3 小時

完成後啟動聊天 UI:

bash
python -m scripts.chat_web

造訪 http://<IP>:8000/ 即可與模型對話。

Scaling Laws 實驗

bash
bash runs/scaling_laws.sh    # 掃描多個 depth 的 scaling 行為
bash runs/miniseries.sh      # 訓練一系列 compute-optimal 模型

快速迭代(~5 分鐘)

bash
OMP_NUM_THREADS=1 torchrun --standalone --nproc_per_node=8 -m scripts.base_train -- \
    --depth=12 --run="d12" --model-tag="d12" --core-metric-every=999999 \
    --sample-every=-1 --save-every=-1

監控 wandb 的 val_bpbcore_metrictrain/mfu 判斷改進效果。

硬體需求

設定GPUVRAM時間費用
GPT-2 speedrun8×H10080GB~2-3 hr~$48
單卡 H1001×H10080GB~16-24 hr~$48
單卡 A1001×A10080GB~24-36 hr~$36
CPU 體驗版CPU/MacN/A~10 min免費

監控指標

  • val_bpb:驗證損失(bits per byte),越低越好
  • core_metric:DCLM CORE 分數,越高越好(GPT-2 = 0.256525)
  • train/mfu:GPU 利用率,越高越好(理想 ~50%+)
  • train/tok_per_sec:訓練吞吐量