BridzikNet (trup + guess/play/value hlavy s maskovanim), self-play generator so zdielanou sietou na 4 sedadlach a opponent mixingom (random/heuristicke sedadla pre robustnost), vlastny clipped-PPO so skalovanim odmien a lr/entropy annealom. Torch je len trenovacia zavislost na hoste (requirements-rl.txt); checkpointy a logy su gitignorovane. Spustenie: py -m rl.train. Co-Authored-By: Claude Fable 5 <noreply@anthropic.com>
6 lines
278 B
Plaintext
6 lines
278 B
Plaintext
# RL trening (rl/model.py, rl/selfplay.py, rl/train.py) -- zamerne oddelene
|
|
# od requirements.txt: server ani Docker image torch nepotrebuju, boti v hre
|
|
# pouzivaju len cisto-Python rl/players.py (a neskor natrenovane vahy cez
|
|
# torch az ked sa neuralny bot nasadi).
|
|
torch>=2.4
|