manifold activation Attention-UNetmanifold based vLLM implementation for training weights.Input1011-dim embeddingEncoder38 x Attention-UNet with 24 headsOutputperplexity projectionCompute budget: 478.1 GFLOPs, 100.1 M parametersTraining configoptimizer=AdamW, lr=0.161, scheduler=polynomial, warmup=968