aboutsummaryrefslogtreecommitdiff
path: root/resources/extract.sh
diff options
context:
space:
mode:
authortslil <tslil@posteo.de>2021-02-11 21:04:42 -0500
committertslil <tslil@posteo.de>2026-08-28 19:37:41 +0100
commit00a04c2929bdc8f8f4bf7d5d8cf413ebfb3cd006 (patch)
tree674e3336175b65e8ab9aa132ad1ea7adc124a121 /resources/extract.sh
parent890eb8d7f4a8c46eae18283ca5ac9c61fd41ed97 (diff)
Don't generate header for training data + tweaks
For some reason it would seem that moving flats to a lower value and increasing the proximity between caps and top flats improves acquisition. Still not great, but every bit counts.
Diffstat (limited to 'resources/extract.sh')
-rwxr-xr-xresources/extract.sh13
1 files changed, 5 insertions, 8 deletions
diff --git a/resources/extract.sh b/resources/extract.sh
index b413d46..0d92ad4 100755
--- a/resources/extract.sh
+++ b/resources/extract.sh
@@ -44,18 +44,15 @@ process() {
./pptdb "$size" "data/good-playtak-$size" generate
echo -en "\tChoosing $num_games of $(wc -l data/training-$size.csv | cut -d\ -f1) samples... "
- head -n 1 "data/training-$size.csv" > "data/shuf-$size.csv"
- tail -n+2 "data/training-$size.csv" > "data/tmp"
- shuf -n $num_games "data/tmp" >> "data/shuf-$size.csv"
- rm data/tmp
+ shuf -n $num_games "data/training-$size.csv" > "data/shuf-$size.csv"
echo -en "Done.\n\tCompressing data... "
mv "data/shuf-$size.csv" "data/$fn-$size.csv"
- if [ -f "data/$fn-$size.csv.gz" ]; then
- rm "data/$fn-$size.csv.gz"
+ if [ -f "data/$fn-$size.csv.zst" ]; then
+ rm "data/$fn-$size.csv.zst"
fi
- gzip "data/$fn-$size.csv"
- echo "Done, available in data/$fn-$size.csv.gz"
+ zstd --rm -13 "data/$fn-$size.csv"
+ echo "Done, available in data/$fn-$size.csv.zst"
}
if [ ! -d data ]; then