Skip to content

閱讀評論

Agent 架構評論

優點

  • 極簡設計:只有三個關鍵檔案,學習成本極低
  • 明確的分工prepare.py 不可修改、train.py 由 Agent 修改、program.md 由人類修改,權責清晰
  • 固定 metricval_bpb 作為客觀比較標準,避免 cherry-picking

缺點

  • 缺乏並行實驗:單 Agent 單 GPU 順序執行,無法利用多 GPU 加速
  • 無 crash recovery:若 Agent 在實驗中途失去 context(如 token 限制),整個循環中斷
  • 單一 Agent 限制:無法同時嘗試多個方向(population-based training)

可重現性問題

潛在風險

  • Agent 修改程式碼的行為取決於 LLM 版本,不同模型、不同日期執行的結果可能不同
  • 缺乏對 Agent 行為的正式規範(formal specification),實驗結果難以驗證
  • results.tsv 僅記錄最終結果,不記錄 Agent 的推理過程

改善建議

  • 加入 Agent 修改 train.py 的 diff 自動存檔
  • 記錄每次實驗的 LLM 版本與 session ID
  • 支援 deterministic seed 以確保可重現性

工程評論

程式碼品質

  • train.py 的 hyperparameter 區塊(ASPECT_RATIODEPTH 等)設計清晰,便於修改
  • prepare.py 的 dataloader 實作(best-fit packing)高效且 100% 利用率
  • 使用 @torch.compile 與 fused kernel 提升效能

不足之處

  • 無 unit test 或 integration test 驗證 Agent 修改後程式碼的正確性
  • 缺少 graceful error handling(Agent 若寫出語法錯誤,直接 crash)
  • 無法限制 Agent 修改範圍(無檔案寫入白名單機制)