LSTM候选记忆元的生成和GRU的隐状态很像,估计是发现简化后效果也类似吧
最原始的数据是(批量, 时间步),然后输入到模型后,内部会做编码,在从零实现中,一般先转置成(时间步, 批量),然后丢到一个onehot encoder里面,把每个时间步输入的词编码成vocab_size维的向量,所以实际模型接受的输入是(时间步, 批量, vocab_size即词表大小),所以它说输入维度是d;然后,如果调用高级API,那么同样模型内部也要编码的,只不是这个时候高级API支持两种格式,一种是(时间步, 批量, vocab_size即词表大小),另一种是(批量,时间步, vocab_size即词表大小),这个用过batch_first参数控制