Appearance
文件重點
核心機制
Agent Loop
- Agent 讀取
program.md→ 修改train.py→ 執行訓練 → 評估結果 → 記錄 → 重複 - 每次實驗約 5 分鐘,每小時約 12 次實驗
- 人類睡眠期間可完成約 100 次實驗
自我修改程式碼(Self-Modifying Code)
- Agent 直接編輯
train.py原始碼,而非使用 config 檔案或 CLI 參數 train.py包含完整 GPT 模型、Muon + AdamW 最佳化器、訓練迴圈- 所有超參數直接在檔案頂部以變數定義(如
DEPTH = 8)
實驗追蹤
results.tsv記錄每次實驗結果,格式:commit\tval_bpb\tmemory_gb\tstatus\tdescription- status 為
keep(改善)、discard(未改善)、crash(失敗) analysis.ipynb提供視覺化分析
技術亮點
模型架構
- GPT + ResFormer(Value Residual)+ Value Embedding
- 滑動視窗注意力(Sliding Window Attention),模式
SSSL - Rotary Position Embedding(RoPE)
- QK-Normalization(查詢與鍵的 RMS Norm)
- Logit Softcapping(
softcap = 15,tanh限制 logits 範圍)
最佳化器
- Muon:用於 2D 矩陣參數,包含 Nesterov momentum、Newton-Schulz 正交化、NorMuon 方差縮減
- AdamW:用於 embedding、lm_head、scalar 參數
- 學習率依
1/sqrt(d_model/768)縮放
資料處理
- climbmix-400b-shuffle 資料集,共 6542 個 parquet shard
- BPE tokenizer(vocab_size=8192),使用 rustbpe 訓練
- BOS-aligned dataloader,best-fit packing 達到 100% 利用率
哲學
- 「研究完全由 AI Agent 自主 swarm 完成」的科幻敘事
- 人類角色從「寫程式」轉變為「寫 program.md」