Skip to content

文件重點

核心機制

Agent Loop

  • Agent 讀取 program.md → 修改 train.py → 執行訓練 → 評估結果 → 記錄 → 重複
  • 每次實驗約 5 分鐘,每小時約 12 次實驗
  • 人類睡眠期間可完成約 100 次實驗

自我修改程式碼(Self-Modifying Code)

  • Agent 直接編輯 train.py 原始碼,而非使用 config 檔案或 CLI 參數
  • train.py 包含完整 GPT 模型、Muon + AdamW 最佳化器、訓練迴圈
  • 所有超參數直接在檔案頂部以變數定義(如 DEPTH = 8

實驗追蹤

  • results.tsv 記錄每次實驗結果,格式:commit\tval_bpb\tmemory_gb\tstatus\tdescription
  • status 為 keep(改善)、discard(未改善)、crash(失敗)
  • analysis.ipynb 提供視覺化分析

技術亮點

模型架構

  • GPT + ResFormer(Value Residual)+ Value Embedding
  • 滑動視窗注意力(Sliding Window Attention),模式 SSSL
  • Rotary Position Embedding(RoPE)
  • QK-Normalization(查詢與鍵的 RMS Norm)
  • Logit Softcapping(softcap = 15tanh 限制 logits 範圍)

最佳化器

  • Muon:用於 2D 矩陣參數,包含 Nesterov momentum、Newton-Schulz 正交化、NorMuon 方差縮減
  • AdamW:用於 embedding、lm_head、scalar 參數
  • 學習率依 1/sqrt(d_model/768) 縮放

資料處理

  • climbmix-400b-shuffle 資料集,共 6542 個 parquet shard
  • BPE tokenizer(vocab_size=8192),使用 rustbpe 訓練
  • BOS-aligned dataloader,best-fit packing 達到 100% 利用率

哲學

  • 「研究完全由 AI Agent 自主 swarm 完成」的科幻敘事
  • 人類角色從「寫程式」轉變為「寫 program.md」