Transformer-XL

E701503

Transformer-XL is a neural network architecture for language modeling that extends the Transformer with segment-level recurrence and relative positional encodings to better capture long-range dependencies.

All labels observed (2)

How this entity was disambiguated

Statements (48)

Predicate Object
instanceOf Transformer variant ⓘ
language model architecture ⓘ
neural network architecture ⓘ
addressesLimitationOf standard Transformer context length ⓘ
aimsTo capture long-range dependencies ⓘ
appliedTo character-level language modeling ⓘ
word-level language modeling ⓘ
benchmarkedOn Enwik8 ⓘ
One Billion Word Benchmark ⓘ
WikiText-103 ⓘ
describedInPaper Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context ⓘ
linked to: Transformer-XL
designedFor language modeling ⓘ
developedAt Carnegie Mellon University ⓘ
linked to: CMU

Google Brain ⓘ
evaluationSpeedupReason reuse of cached hidden states ⓘ
extends Transformer ⓘ
hasFullName Transformer eXtra Long ⓘ
hasKeyConcept decoupling positional encoding from absolute positions ⓘ
reusing hidden states from previous segments ⓘ
improves evaluation efficiency ⓘ
modeling of long-term dependencies ⓘ
training efficiency for long sequences ⓘ
improvesMetric perplexity on language modeling benchmarks ⓘ
influenced later long-context Transformer architectures ⓘ
introducedFeature relative positional encodings ⓘ
segment-level recurrence ⓘ
memoryMechanismType segment-level recurrence over hidden states ⓘ
outperforms standard Transformer on long-context language modeling benchmarks ⓘ
paperPublishedAt ACL 2019 ⓘ
positionalEncodingType relative positional encoding ⓘ
proposedBy Jaime Carbonell ⓘ
Quoc V. Le ⓘ
Ruslan Salakhutdinov ⓘ
William W. Cohen ⓘ
Yiming Yang ⓘ
Zhilin Yang ⓘ
Zihang Dai ⓘ
proposedIn 2019 ⓘ
reduces context fragmentation ⓘ
supports longer effective context than vanilla Transformer ⓘ
trainingObjective autoregressive language modeling ⓘ
uses layer normalization ⓘ
memory mechanism ⓘ
multi-head attention ⓘ
position-wise feed-forward networks ⓘ
relative positional embeddings ⓘ
residual connections ⓘ
self-attention ⓘ

How these facts were elicited

Referenced by (4)

Full triples — surface form annotated when it differs from this entity's canonical label.

Layer Normalization → usedIn → Transformer-XL ⓘ
XLNet → relatedTo → Transformer-XL ⓘ
XLNet → extends → Transformer-XL ⓘ
Transformer-XL → describedInPaper → Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context ⓘ
linked to: Transformer-XL