Pith. sign in

Paper Citation Record · LEDGER

Enabling Autoregressive Models to Fill In Masked Tokens

As of 9 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 1 inbound Pith citation observation for arXiv:2502.06901.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2502.06901 v1

Coverage vector

measured 50 of 50 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-08T17:10:39.863142Z

measured 51 of 51 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-09T06:31:02.800959+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-05-17T02:05:18.834924Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-17T02:05:18.893265Z

Reference resolution

50 of 50 outbound references displayed

  • verified exact1
  • verified fuzzy7
  • unresolved42
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 45ceeb89-ee0b-437b-8672-b55d2db58788 · outbound

This paper cites write newline.

Enabling Autoregressive Models to Fill In Masked Tokens write newline

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-08T17:10:39.679309Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T17:10:39.679309Z digest=sha256:0e0fb3a5b7bd36ba1f4cabe108124e9dc54b3b5bfb20eb5a089b70786550e981

Observation aa9b1412-ec3b-4e36-9a12-e63d306dff77 · outbound

This paper cites GPT-4 Technical Report.

Enabling Autoregressive Models to Fill In Masked Tokens GPT-4 Technical Report

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-08T17:10:39.683696Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T17:10:39.683696Z digest=sha256:d8a38f3ca2e584f5bb7a5bc9afd9c4fcc6e81493ab03364be7285a20f18624e6

Observation e573142e-5f56-4e34-b7c8-e45e4447d3d4 · outbound

This paper cites and Tsitsiklis, J.

Enabling Autoregressive Models to Fill In Masked Tokens and Tsitsiklis, J

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T17:10:40.366042Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-08T17:10:39.687735Z digest=sha256:72950d4c9267640958940e490da857a8c3124d0d0812cf51a40cca6da4caf5f6

Observation 01600c16-c573-41cb-a439-fcd9e478fa0d · outbound

This paper cites One billion word benchmark for measuring progress in statistical language modeling, 2014.

Enabling Autoregressive Models to Fill In Masked Tokens One billion word benchmark for measuring progress in statistical language modeling, 2014

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T17:10:40.355029Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-08T17:10:39.691337Z digest=sha256:137cbc61b8d9ab03384b914b975c97ed2dc737f624a38cf6e71ae5534936946a

Observation 58e772f8-d8c5-4d81-9a88-57d93e7104db · outbound

This paper cites Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference.

Enabling Autoregressive Models to Fill In Masked Tokens Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-08T17:10:39.695329Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T17:10:39.695329Z digest=sha256:f621dba4957260f0a01d87b4e793a1779ac585f43a22e7da3ef0b95c175a20cf

Observation c4520c0a-6d43-4058-8f5a-7ae5d29b1778 · outbound

This paper cites B., Bierbaum, M., O'Keeffe, K.

Enabling Autoregressive Models to Fill In Masked Tokens B., Bierbaum, M., O'Keeffe, K

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-08T17:10:39.699400Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T17:10:39.699400Z digest=sha256:bf7c976ffc904e494c4a84cef6ed14fc4bfc53295bc9bf8009bd2255047700e1

Observation aa22d8de-870e-4f6b-af3e-971308a88e9a · outbound

This paper cites BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding.

Enabling Autoregressive Models to Fill In Masked Tokens BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-08T17:10:39.703116Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T17:10:39.703116Z digest=sha256:6ca23f3b503b83017299d9b67c775abb8e81c19707453827a64b6c98448ffc4c

Observation e54ac4dd-2c52-418e-bce5-dc530a7ef369 · outbound

This paper cites Enabling Language Models to Fill in the Blanks.

Enabling Autoregressive Models to Fill In Masked Tokens Enabling Language Models to Fill in the Blanks

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-08T17:10:39.707483Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T17:10:39.707483Z digest=sha256:63bbda526dadf00141d397d322acaeb71c97569fb3d8c2d28390f8a375dafee4

Observation 9a255a77-acb0-4288-bba8-2ddfc9be5f11 · outbound

This paper cites GLM: General Language Model Pretraining with Autoregressive Blank Infilling.

Enabling Autoregressive Models to Fill In Masked Tokens GLM: General Language Model Pretraining with Autoregressive Blank Infilling

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-08T17:10:39.711429Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T17:10:39.711429Z digest=sha256:32ae51767ed747a07d386c8e1c2db6a0eb811e5d946a295742c8bce7996c9061

Observation 4242e82c-bb5e-4a14-ace2-bc95bdb7a307 · outbound

This paper cites InCoder: A Generative Model for Code Infilling and Synthesis.

Enabling Autoregressive Models to Fill In Masked Tokens InCoder: A Generative Model for Code Infilling and Synthesis

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-08T17:10:39.715104Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T17:10:39.715104Z digest=sha256:2acbcc884fc77584ae7dd76c272314429cd1fee6cfacd8ed092d51c4c59bdc5f

Observation 24f7c9a0-1632-4011-acfd-8a875586ff9b · outbound

This paper cites Scaling Diffusion Language Models via Adaptation from Autoregressive Models.

Enabling Autoregressive Models to Fill In Masked Tokens Scaling Diffusion Language Models via Adaptation from Autoregressive Models

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-08T17:10:39.719321Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T17:10:39.719321Z digest=sha256:711574e8d7a59194ca6065c43067c488b983f6ad8e167f6f415706047cd61046

Observation dbbcb1ea-bf3a-4385-8f2c-db9ba5aa9370 · outbound

This paper cites The Llama 3 Herd of Models.

Enabling Autoregressive Models to Fill In Masked Tokens The Llama 3 Herd of Models

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-08T17:10:39.723058Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T17:10:39.723058Z digest=sha256:cdf7e99c1b4ae4abb92e9b904c3e9d46082c01af7941af2a86beedf7320cebeb

Observation 4eb12ada-59d4-4657-acfb-ffc2535bcd7f · outbound

This paper cites OLMo: Accelerating the Science of Language Models.

Enabling Autoregressive Models to Fill In Masked Tokens OLMo: Accelerating the Science of Language Models

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-08T17:10:39.726249Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T17:10:39.726249Z digest=sha256:311542e703252df38028412ac267d8df8c51dfc780afb2e58ba0add5e8552580

Observation e193fb6a-9c63-48e5-9e23-47c67a05afbe · outbound

This paper cites Likelihood-Based Diffusion Language Models.

Enabling Autoregressive Models to Fill In Masked Tokens Likelihood-Based Diffusion Language Models

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-08T17:10:39.729397Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T17:10:39.729397Z digest=sha256:d8d0db86f20400980b6a2e8a9ec73c1a2f94e1457d21ceafb1cfe09e926f5c64

Observation 48ee7a31-8f0d-411e-9470-6010de50c662 · outbound

This paper cites an unresolved cited work.

Enabling Autoregressive Models to Fill In Masked Tokens Unresolved cited work

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-08T17:10:39.732855Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T17:10:39.732855Z digest=sha256:b351b20f1b311de2f9dc34fc20a55c8e512e267283a7bf208d1065e2e723e40a

Observation 968eef7d-538b-40c6-9618-97a694d26076 · outbound

This paper cites Denoising Diffusion Probabilistic Models.

Enabling Autoregressive Models to Fill In Masked Tokens Denoising Diffusion Probabilistic Models

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-08T17:10:39.736815Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T17:10:39.736815Z digest=sha256:12839334907281f41898fd4964508827292d216b570e36e3737b69c793a16740

Observation d1ebc4c2-b695-4d4a-a0a3-88643b99ee76 · outbound

This paper cites The Curious Case of Neural Text Degeneration.

Enabling Autoregressive Models to Fill In Masked Tokens The Curious Case of Neural Text Degeneration

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-08T17:10:39.740563Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T17:10:39.740563Z digest=sha256:ce92b3d7880af53a08ead934d7814d2a3081a8340707deed3678454ed4165db0

Observation 7e2421f2-f268-4ed5-a450-08f6fb4d9dc3 · outbound

This paper cites Autoregressive Diffusion Models.

Enabling Autoregressive Models to Fill In Masked Tokens Autoregressive Diffusion Models

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-08T17:10:39.744140Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T17:10:39.744140Z digest=sha256:f26ed76dbf90c407ae99a47dc4b60ee62dd31f056b05da74e4bb005ff17b3b30

Observation e62cf978-a81a-4b93-abe4-ade911d4ec97 · outbound

This paper cites Variational Diffusion Models.

Enabling Autoregressive Models to Fill In Masked Tokens Variational Diffusion Models

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-08T17:10:39.748997Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T17:10:39.748997Z digest=sha256:f828da729278353f79c8c016efeb717191d503ebc35a7d94c3c3db31b8ad20b7

Observation fb27396a-9ecc-4e2f-a49b-3978f4bd7d2d · outbound

This paper cites H., Gonzalez, J., Zhang, H., and Stoica, I.

Enabling Autoregressive Models to Fill In Masked Tokens H., Gonzalez, J., Zhang, H., and Stoica, I

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-08T17:10:39.752819Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T17:10:39.752819Z digest=sha256:41fc72afc75281832633414b34b353897c4b8f034081bdf91ef59916f7e5ee8b

Observation b886ea01-81ee-45fd-a766-ccd00f46ae64 · outbound

This paper cites Coauthor: Designing a human-ai collaborative writing dataset for exploring language model capabilities.

Enabling Autoregressive Models to Fill In Masked Tokens Coauthor: Designing a human-ai collaborative writing dataset for exploring language model capabilities

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T17:10:40.323480Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-08T17:10:39.756278Z digest=sha256:25c3e1e6c6f3e5a3aea39e0498b0e4dab6cddc454f446b2a25d11c3c85c54d75

Observation 92705d52-cb0f-430d-9ecf-6c84ddec48a3 · outbound

This paper cites BART: Denoising Sequence-to-Sequence Pre-training for Natural Language Generation, Translation, and Comprehension.

Enabling Autoregressive Models to Fill In Masked Tokens BART: Denoising Sequence-to-Sequence Pre-training for Natural Language Generation, Translation, and Comprehension

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-08T17:10:39.760569Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T17:10:39.760569Z digest=sha256:21b0fdf6336a817afa8e89f95938174edfc4d0ee1e1fd0d29ec22cd48faf7602

Observation 6c066e2a-a343-4593-8d26-203564067ceb · outbound

This paper cites DExperts: Decoding-Time Controlled Text Generation with Experts and Anti-Experts.

Enabling Autoregressive Models to Fill In Masked Tokens DExperts: Decoding-Time Controlled Text Generation with Experts and Anti-Experts

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-08T17:10:39.764528Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T17:10:39.764528Z digest=sha256:41b2ce924f85c57f4d3a6a24a727be7bed0bddf4c910b651f1bdc3d8c14d8882

Observation 5de9f587-e63d-415a-8319-08328890cb91 · outbound

This paper cites Discrete Copula Diffusion.

Enabling Autoregressive Models to Fill In Masked Tokens Discrete Copula Diffusion

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-08T17:10:39.767786Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T17:10:39.767786Z digest=sha256:60b7b41a6ac132c0a03c9dbd913b6f2873e6ac588e248882c61b215772fc90bd

Observation d86f4111-c2ca-4400-9506-c771462a25e6 · outbound

This paper cites Multi-task learning based pre-trained language model for code completion.

Enabling Autoregressive Models to Fill In Masked Tokens Multi-task learning based pre-trained language model for code completion

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T17:10:40.312183Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-08T17:10:39.771189Z digest=sha256:a69e9dae6e85752bd3014b34df1b7b3d4e69ac333190a9b536dace5e3c4d3314

Observation c40bb9f5-b970-4f5e-9c2a-72be2c6c62d1 · outbound

This paper cites Think While You Generate: Discrete Diffusion with Planned Denoising.

Enabling Autoregressive Models to Fill In Masked Tokens Think While You Generate: Discrete Diffusion with Planned Denoising

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-08T17:10:39.774186Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T17:10:39.774186Z digest=sha256:4d2f2ea34926680a90351b4712636cb699401ac3584cf03b086061435b77611b

Observation 5f49b491-0638-4fe5-b7aa-7f6189e74055 · outbound

This paper cites Scissorhands: Exploiting the persistence of importance hypothesis for llm kv cache compression at test time.

Enabling Autoregressive Models to Fill In Masked Tokens Scissorhands: Exploiting the persistence of importance hypothesis for llm kv cache compression at test time

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T17:10:40.300241Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-08T17:10:39.778773Z digest=sha256:2348bd80048afd199658e264789b9868506c663eff884fa2ba38213bb9308e29

Observation 06bb53cc-98f8-4a9d-aa0d-3a1ef204a551 · outbound

This paper cites Discrete diffusion language modeling by estimating the ratios of the data distribution.

Enabling Autoregressive Models to Fill In Masked Tokens Discrete diffusion language modeling by estimating the ratios of the data distribution

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T17:10:40.288372Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-08T17:10:39.782296Z digest=sha256:e79c28c2767182900df5a709510a06c8c9ea173f2cd4cc10faf32c57503f7dd7

Observation 5e549bb7-c074-4fa7-9bc8-89c595d637e7 · outbound

This paper cites an unresolved cited work.

Enabling Autoregressive Models to Fill In Masked Tokens Unresolved cited work

Reference 29

Resolution
unresolved
raw_fallback, observed 2026-08-08T17:10:40.275356Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-08T17:10:39.786049Z digest=sha256:0c59748e8e3cf900024e85aefdb2d1f626d46f7fff3fea0140f0ad0987161ada

Observation 9143eb05-2bda-4d7d-967a-f69500c7f729 · outbound

This paper cites Pointer sentinel mixture models, 2016.

Enabling Autoregressive Models to Fill In Masked Tokens Pointer sentinel mixture models, 2016

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-08T17:10:39.789928Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T17:10:39.789928Z digest=sha256:2f41861de56991b1e9481763414d7a71dbb7cda462e1026c96f2ca5f1bd333da

Observation 0d302c15-0ae8-4383-81bc-c27efeb2e2ff · outbound

This paper cites Meet in the Middle: A New Pre-training Paradigm.

Enabling Autoregressive Models to Fill In Masked Tokens Meet in the Middle: A New Pre-training Paradigm

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-08T17:10:39.794278Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T17:10:39.794278Z digest=sha256:eefa0486f5c80b133dd80d1415c2c686ab4cee122e6269b74ce5d4b87e9ae678

Observation 6eb88fef-74fb-480a-af46-1c9c9499e48d · outbound

This paper cites Scaling up Masked Diffusion Models on Text.

Enabling Autoregressive Models to Fill In Masked Tokens Scaling up Masked Diffusion Models on Text

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-08T17:10:39.797937Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T17:10:39.797937Z digest=sha256:1e6943f931dfb13bfbc0e21c166a4fd376193dad5dedf135f9bfaab891853d37

Observation acc9f699-998e-42db-9012-1388bd6c97a9 · outbound

This paper cites Your Absorbing Discrete Diffusion Secretly Models the Conditional Distributions of Clean Data.

Enabling Autoregressive Models to Fill In Masked Tokens Your Absorbing Discrete Diffusion Secretly Models the Conditional Distributions of Clean Data

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-08T17:10:39.801915Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T17:10:39.801915Z digest=sha256:84739326028e3e31273dba8ac1840eb37ef04404752268a9f2ebddb1ef533102

Observation 28bc4620-320d-40f1-b56c-8b60d4f1b549 · outbound

This paper cites The LAMBADA dataset: Word prediction requiring a broad discourse context.

Enabling Autoregressive Models to Fill In Masked Tokens The LAMBADA dataset: Word prediction requiring a broad discourse context

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-08T17:10:39.805621Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T17:10:39.805621Z digest=sha256:f7fdff6b4694df348f60fbcaaa6d94ca607afa6546f9589499509490f98174d0

Observation 32c2ace4-0804-4bff-9f5a-8690dabc4b0a · outbound

This paper cites The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale.

Enabling Autoregressive Models to Fill In Masked Tokens The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-08T17:10:39.809561Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T17:10:39.809561Z digest=sha256:fa524ae10173b26bafaddad3cec6850bd9ceec958e9965e43f20051f2afdbdb8

Observation 38ef1f46-d3f0-45da-aa88-1124671e7d22 · outbound

This paper cites Language models are unsupervised multitask learners.

Enabling Autoregressive Models to Fill In Masked Tokens Language models are unsupervised multitask learners

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-08T17:10:39.813372Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T17:10:39.813372Z digest=sha256:86a01320a92861ca6af4639f30e09dde6c5f37e381adfa1b19089224e7aef6a9

Observation 025c07d4-cfa7-459f-8ff5-a347b04b23df · outbound

This paper cites Simple and Effective Masked Diffusion Language Models.

Enabling Autoregressive Models to Fill In Masked Tokens Simple and Effective Masked Diffusion Language Models

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-08T17:10:39.816372Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T17:10:39.816372Z digest=sha256:51dcbb9e3e79c5b0a10e2fc2fe6843f7e70e0594538d62da2baeb65b3bf03573

Observation 1026cd01-100b-4f3a-8d0a-91fd78437d97 · outbound

This paper cites Scaling Smart: Accelerating Large Language Model Pre-training with Small Model Initialization.

Enabling Autoregressive Models to Fill In Masked Tokens Scaling Smart: Accelerating Large Language Model Pre-training with Small Model Initialization

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-08T17:10:39.819680Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T17:10:39.819680Z digest=sha256:28474414e169ce3e5728844486336669cc1aea52f65e3e76ddedf8fd68a51815

Observation 3bb74a02-3c28-4a66-999c-a45a4e69665b · outbound

This paper cites BERTs are Generative In-Context Learners.

Enabling Autoregressive Models to Fill In Masked Tokens BERTs are Generative In-Context Learners

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-08T17:10:39.822853Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T17:10:39.822853Z digest=sha256:cd4893904de204c3a892b7e7a9388e9b08bf911cd719b812abb256ad99962bd9

Observation 81ac30c0-0010-49de-a9b3-87e796c9129e · outbound

This paper cites Introduction to the CoNLL-2003 Shared Task: Language-Independent Named Entity Recognition.

Enabling Autoregressive Models to Fill In Masked Tokens Introduction to the CoNLL-2003 Shared Task: Language-Independent Named Entity Recognition

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-08T17:10:39.825969Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T17:10:39.825969Z digest=sha256:707ff27ddd17d7bda3f4bf22de8df5cfb0038c8ebd2c83992516f59bebffa381

Observation da39abf7-16ed-4c1d-b224-23d37adaedd7 · outbound

This paper cites FiLM: Fill-in Language Models for Any-Order Generation.

Enabling Autoregressive Models to Fill In Masked Tokens FiLM: Fill-in Language Models for Any-Order Generation

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-08T17:10:39.829805Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T17:10:39.829805Z digest=sha256:905e361c9aff9bd632ed05d3537163ccee26d964f9630e4e425cc19a4f3c3153

Observation e5b9d0ce-9604-47de-8fee-e56bc88f3b1e · outbound

This paper cites Long horizon temperature scaling.

Enabling Autoregressive Models to Fill In Masked Tokens Long horizon temperature scaling

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-08-08T17:10:40.250448Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-08T17:10:39.833475Z digest=sha256:b8acf149403c10d0e1fd0358b145251c454b1616ddf05c0220dcf753fe5fea43

Observation 96e8022d-ec5e-44db-9812-ba330e4e52ba · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

Enabling Autoregressive Models to Fill In Masked Tokens LLaMA: Open and Efficient Foundation Language Models

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-08T17:10:39.837397Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T17:10:39.837397Z digest=sha256:0f2634be4dd2f69716fb960b6ae26dad99f802df593ff1dd49277e3ee1e9ee54

Observation 59df9685-7ca3-4afe-8594-691462055097 · outbound

This paper cites Attention is all you need.

Enabling Autoregressive Models to Fill In Masked Tokens Attention is all you need

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-08T17:10:39.840865Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T17:10:39.840865Z digest=sha256:0d903bbee2fe0f6b8634c5f163531c602061edfe40e8165134f20e36e602a93e

Observation bd2e9aa9-c568-4098-a642-394e4aa87d57 · outbound

This paper cites Smarter, Better, Faster, Longer: A Modern Bidirectional Encoder for Fast, Memory Efficient, and Long Context Finetuning and Inference.

Enabling Autoregressive Models to Fill In Masked Tokens Smarter, Better, Faster, Longer: A Modern Bidirectional Encoder for Fast, Memory Efficient, and Long Context Finetuning and Inference

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-08T17:10:39.844222Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T17:10:39.844222Z digest=sha256:715a65593477ee4c1208de87163af94ed63b9925d19a3db0533df2555543d8c9

Observation 449781f1-aa04-4d85-9d85-8fefacf44433 · outbound

This paper cites FOFO: A Benchmark to Evaluate LLMs' Format-Following Capability.

Enabling Autoregressive Models to Fill In Masked Tokens FOFO: A Benchmark to Evaluate LLMs' Format-Following Capability

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-08T17:10:39.848115Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T17:10:39.848115Z digest=sha256:cae921e88ec94800b3183bc6cba210e6eac60202cbb61e07b448f8a0488bbb61

Observation 07fc3082-f54e-4699-8617-996902045114 · outbound

This paper cites AntLM: Bridging Causal and Masked Language Models.

Enabling Autoregressive Models to Fill In Masked Tokens AntLM: Bridging Causal and Masked Language Models

Reference 47

Resolution
verified exact
local_arxiv, observed 2026-08-08T17:10:39.931496Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-08T17:10:39.851945Z digest=sha256:7cbe89f902afd48d9567c3de0037509a6de901702bdee66e002347cc70ac2229

Observation 90600637-0f5f-4e81-90aa-9ccd8a3b7a98 · outbound

This paper cites Character-level Convolutional Networks for Text Classification.

Enabling Autoregressive Models to Fill In Masked Tokens Character-level Convolutional Networks for Text Classification

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-08T17:10:39.855961Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T17:10:39.855961Z digest=sha256:48ecdffd3481d1d78f22f5b32d5bc3b45c372f7f9a71d99f9827cca3535f289c

Observation 56c57e3a-696d-4189-b0b7-dea6c0b062c8 · outbound

This paper cites Prepacking: A Simple Method for Fast Prefilling and Increased Throughput in Large Language Models.

Enabling Autoregressive Models to Fill In Masked Tokens Prepacking: A Simple Method for Fast Prefilling and Increased Throughput in Large Language Models

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-08T17:10:39.859709Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T17:10:39.859709Z digest=sha256:48c5ab3ba8171b9f72609d08cc1e400272e70cace07e948683e955a859f6b9ad

Observation 4658089a-70a2-4a5b-a299-6077e0b480db · outbound

This paper cites A Survey of Large Language Models.

Enabling Autoregressive Models to Fill In Masked Tokens A Survey of Large Language Models

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-08T17:10:39.863142Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T17:10:39.863142Z digest=sha256:c8ced56aa6f978119359f8d09376fe135ff7edf1f70807a94c1f111e69f127e6

Pith citing papers

Observation a569b31d-131c-4fda-9330-69ec8d02b2fa · inbound

Mercury: Ultra-Fast Language Models Based on Diffusion cites this paper.

Mercury: Ultra-Fast Language Models Based on Diffusion Enabling Autoregressive Models to Fill In Masked Tokens

Reference 24

Resolution
verified exact
arxiv_id, observed 2026-05-17T02:05:18.895176Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-17T02:05:18.834924Z digest=sha256:1bb333fe04f46f188c1d22f0d47f85a484cc6d3a390fcc43d370c062e2d18c3c