One linear projection W_Q produces d_model features. Reshape to (N, h, d_k) treats them as h heads of d_k each.
After attention: reshape concat to (N, d_model). Final W_O mixes heads' outputs.