Appearance
閱讀評論
Agent 架構評論
優點
- 極簡設計:只有三個關鍵檔案,學習成本極低
- 明確的分工:
prepare.py不可修改、train.py由 Agent 修改、program.md由人類修改,權責清晰 - 固定 metric:
val_bpb作為客觀比較標準,避免 cherry-picking
缺點
- 缺乏並行實驗:單 Agent 單 GPU 順序執行,無法利用多 GPU 加速
- 無 crash recovery:若 Agent 在實驗中途失去 context(如 token 限制),整個循環中斷
- 單一 Agent 限制:無法同時嘗試多個方向(population-based training)
可重現性問題
潛在風險
- Agent 修改程式碼的行為取決於 LLM 版本,不同模型、不同日期執行的結果可能不同
- 缺乏對 Agent 行為的正式規範(formal specification),實驗結果難以驗證
results.tsv僅記錄最終結果,不記錄 Agent 的推理過程
改善建議
- 加入 Agent 修改
train.py的 diff 自動存檔 - 記錄每次實驗的 LLM 版本與 session ID
- 支援 deterministic seed 以確保可重現性
工程評論
程式碼品質
train.py的 hyperparameter 區塊(ASPECT_RATIO、DEPTH等)設計清晰,便於修改prepare.py的 dataloader 實作(best-fit packing)高效且 100% 利用率- 使用
@torch.compile與 fused kernel 提升效能
不足之處
- 無 unit test 或 integration test 驗證 Agent 修改後程式碼的正確性
- 缺少 graceful error handling(Agent 若寫出語法錯誤,直接 crash)
- 無法限制 Agent 修改範圍(無檔案寫入白名單機制)