torch.manual_seed(123) ​ block_size = embedded_sentence.shape[1] mha = MultiHeadAttentionWrapper( d_in, d_out_kq, d_out_v, num_heads=4 ) ​ context_vecs = mha(embedded_sentence) ​ print(context_vecs) print("context_vecs.shape:", context_vecs.shape)