{"as_of":"2026-08-09T12:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a837c3d417afff1130030a73e7b4f9d244b087925a5953cc535371d1d0947004","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T17:10:39.863142Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-17T02:05:18.834924Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-17T02:05:18.893265Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-08T17:00:41.319015Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"cited_work":{"arxiv_id":"2502.06901","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06901","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Enabling autoregressive models to fill in masked tokens.arXiv preprint arXiv:2502.06901","venue":null,"work_id":"13eeae4b-700d-4cdb-8c3d-4623c12b4e30","year":2025},"citing_paper":{"arxiv_id":"2506.17298","last_updated":"2025-06-17T17:06:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-17T17:06:18Z","title":"Mercury: Ultra-Fast Language Models Based on Diffusion","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-17T02:05:18.834924Z"},"links":{"cited_paper":"/paper/2502.06901","citing_paper":"/paper/2506.17298"},"observation_digest":"sha256:1bb333fe04f46f188c1d22f0d47f85a484cc6d3a390fcc43d370c062e2d18c3c","observation_id":"a569b31d-131c-4fda-9330-69ec8d02b2fa","resolution":{"observed_at":"2026-05-17T02:05:18.895176Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.06901/citation-record","integrity":"/paper/2502.06901/integrity","json":"/paper/2502.06901/citation-record.json","paper":"/paper/2502.06901"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:10:39.679309Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-08T17:00:41.319015Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.679309Z"},"links":{"citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:0e0fb3a5b7bd36ba1f4cabe108124e9dc54b3b5bfb20eb5a089b70786550e981","observation_id":"45ceeb89-ee0b-437b-8672-b55d2db58788","resolution":{"observed_at":"2026-08-08T17:10:39.679309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-08T17:10:39.683696Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-08T17:00:41.319015Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.683696Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:d8a38f3ca2e584f5bb7a5bc9afd9c4fcc6e81493ab03364be7285a20f18624e6","observation_id":"aa9b1412-ec3b-4e36-9a12-e63d306dff77","resolution":{"observed_at":"2026-08-08T17:10:39.683696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:10:40.362436Z","title":"and Tsitsiklis, J","venue":null,"work_id":"93d8b0c1-964f-4fe7-8105-cb46234b0bf5","year":1993},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-08T17:00:41.319015Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.687735Z"},"links":{"citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:72950d4c9267640958940e490da857a8c3124d0d0812cf51a40cca6da4caf5f6","observation_id":"e573142e-5f56-4e34-b7c8-e45e4447d3d4","resolution":{"observed_at":"2026-08-08T17:10:40.366042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:10:40.350911Z","title":"One billion word benchmark for measuring progress in statistical language modeling, 2014","venue":null,"work_id":"efa90d4e-8522-47fd-aee4-7b046c2b30f9","year":2014},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-08T17:00:41.319015Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.691337Z"},"links":{"citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:137cbc61b8d9ab03384b914b975c97ed2dc737f624a38cf6e71ae5534936946a","observation_id":"01600c16-c573-41cb-a439-fcd9e478fa0d","resolution":{"observed_at":"2026-08-08T17:10:40.355029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04132","last_updated":"2024-03-07T01:22:38Z","snapshot_observed_at":"2026-08-02T17:55:33.750637Z","submitted_at":"2024-03-07T01:22:38Z","title":"Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04132","snapshot_observed_at":"2026-08-08T17:10:39.695329Z","title":"N., Li, T., Li, D., Zhang, H., Zhu, B., Jordan, M., Gonzalez, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-08T17:00:41.319015Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.695329Z"},"links":{"cited_paper":"/paper/2403.04132","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:f621dba4957260f0a01d87b4e793a1779ac585f43a22e7da3ef0b95c175a20cf","observation_id":"58e772f8-d8c5-4d81-9a88-57d93e7104db","resolution":{"observed_at":"2026-08-08T17:10:39.695329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:10:39.699400Z","title":"B., Bierbaum, M., O'Keeffe, K","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-08T17:00:41.319015Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.699400Z"},"links":{"citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:bf7c976ffc904e494c4a84cef6ed14fc4bfc53295bc9bf8009bd2255047700e1","observation_id":"c4520c0a-6d43-4058-8f5a-7ae5d29b1778","resolution":{"observed_at":"2026-08-08T17:10:39.699400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-08T17:10:39.703116Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-08T17:00:41.319015Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.703116Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:6ca23f3b503b83017299d9b67c775abb8e81c19707453827a64b6c98448ffc4c","observation_id":"aa22d8de-870e-4f6b-af3e-971308a88e9a","resolution":{"observed_at":"2026-08-08T17:10:39.703116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.05339","last_updated":"2020-09-10T18:03:11Z","snapshot_observed_at":"2026-08-09T05:50:20.229058Z","submitted_at":"2020-05-11T18:00:03Z","title":"Enabling Language Models to Fill in the Blanks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.05339","snapshot_observed_at":"2026-08-08T17:10:39.707483Z","title":"Enabling language models to fill in the blanks","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-08T17:00:41.319015Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.707483Z"},"links":{"cited_paper":"/paper/2005.05339","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:63bbda526dadf00141d397d322acaeb71c97569fb3d8c2d28390f8a375dafee4","observation_id":"e54ac4dd-2c52-418e-bce5-dc530a7ef369","resolution":{"observed_at":"2026-08-08T17:10:39.707483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.10360","last_updated":"2022-03-17T11:49:55Z","snapshot_observed_at":"2026-07-06T10:51:12.871009Z","submitted_at":"2021-03-18T16:30:26Z","title":"GLM: General Language Model Pretraining with Autoregressive Blank Infilling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.10360","snapshot_observed_at":"2026-08-08T17:10:39.711429Z","title":"Glm: General language model pretraining with autoregressive blank infilling, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-08T17:00:41.319015Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.711429Z"},"links":{"cited_paper":"/paper/2103.10360","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:32ae51767ed747a07d386c8e1c2db6a0eb811e5d946a295742c8bce7996c9061","observation_id":"9a255a77-acb0-4288-bba8-2ddfc9be5f11","resolution":{"observed_at":"2026-08-08T17:10:39.711429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05999","last_updated":"2023-04-09T14:31:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T16:25:26Z","title":"InCoder: A Generative Model for Code Infilling and Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05999","snapshot_observed_at":"2026-08-08T17:10:39.715104Z","title":"Incoder: A generative model for code infilling and synthesis, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-08T17:00:41.319015Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.715104Z"},"links":{"cited_paper":"/paper/2204.05999","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:2acbcc884fc77584ae7dd76c272314429cd1fee6cfacd8ed092d51c4c59bdc5f","observation_id":"4242e82c-bb5e-4a14-ace2-bc95bdb7a307","resolution":{"observed_at":"2026-08-08T17:10:39.715104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17891","last_updated":"2025-05-31T07:01:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-23T14:04:22Z","title":"Scaling Diffusion Language Models via Adaptation from Autoregressive Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17891","snapshot_observed_at":"2026-08-08T17:10:39.719321Z","title":"Scaling diffusion language models via adaptation from autoregressive models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-08T17:00:41.319015Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.719321Z"},"links":{"cited_paper":"/paper/2410.17891","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:711574e8d7a59194ca6065c43067c488b983f6ad8e167f6f415706047cd61046","observation_id":"24f7c9a0-1632-4011-acfd-8a875586ff9b","resolution":{"observed_at":"2026-08-08T17:10:39.719321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-08T17:10:39.723058Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-08T17:00:41.319015Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.723058Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:cdf7e99c1b4ae4abb92e9b904c3e9d46082c01af7941af2a86beedf7320cebeb","observation_id":"dbbcb1ea-bf3a-4385-8f2c-db9ba5aa9370","resolution":{"observed_at":"2026-08-08T17:10:39.723058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00838","last_updated":"2024-06-07T21:59:52Z","snapshot_observed_at":"2026-07-06T17:23:51.547578Z","submitted_at":"2024-02-01T18:28:55Z","title":"OLMo: Accelerating the Science of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00838","snapshot_observed_at":"2026-08-08T17:10:39.726249Z","title":"H., Ivison, H., Magnusson, I., Wang, Y., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-08T17:00:41.319015Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.726249Z"},"links":{"cited_paper":"/paper/2402.00838","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:311542e703252df38028412ac267d8df8c51dfc780afb2e58ba0add5e8552580","observation_id":"4eb12ada-59d4-4657-acfb-ffc2535bcd7f","resolution":{"observed_at":"2026-08-08T17:10:39.726249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18619","last_updated":"2023-05-30T16:43:31Z","snapshot_observed_at":"2026-08-03T06:04:27.414689Z","submitted_at":"2023-05-30T16:43:31Z","title":"Likelihood-Based Diffusion Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18619","snapshot_observed_at":"2026-08-08T17:10:39.729397Z","title":"and Hashimoto, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-08T17:00:41.319015Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.729397Z"},"links":{"cited_paper":"/paper/2305.18619","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:d8d0db86f20400980b6a2e8a9ec73c1a2f94e1457d21ceafb1cfe09e926f5c64","observation_id":"e193fb6a-9c63-48e5-9e23-47c67a05afbe","resolution":{"observed_at":"2026-08-08T17:10:39.729397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:10:39.732855Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-08T17:00:41.319015Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.732855Z"},"links":{"citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:b351b20f1b311de2f9dc34fc20a55c8e512e267283a7bf208d1065e2e723e40a","observation_id":"48ee7a31-8f0d-411e-9470-6010de50c662","resolution":{"observed_at":"2026-08-08T17:10:39.732855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.11239","last_updated":"2020-12-16T21:15:05Z","snapshot_observed_at":"2026-07-06T09:30:47.469703Z","submitted_at":"2020-06-19T17:24:44Z","title":"Denoising Diffusion Probabilistic Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.11239","snapshot_observed_at":"2026-08-08T17:10:39.736815Z","title":"Denoising diffusion probabilistic models, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-08T17:00:41.319015Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.736815Z"},"links":{"cited_paper":"/paper/2006.11239","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:12839334907281f41898fd4964508827292d216b570e36e3737b69c793a16740","observation_id":"968eef7d-538b-40c6-9618-97a694d26076","resolution":{"observed_at":"2026-08-08T17:10:39.736815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09751","last_updated":"2020-02-14T21:56:30Z","snapshot_observed_at":"2026-07-06T07:47:32.745963Z","submitted_at":"2019-04-22T07:17:18Z","title":"The Curious Case of Neural Text Degeneration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09751","snapshot_observed_at":"2026-08-08T17:10:39.740563Z","title":"The curious case of neural text degeneration, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-08T17:00:41.319015Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.740563Z"},"links":{"cited_paper":"/paper/1904.09751","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:ce92b3d7880af53a08ead934d7814d2a3081a8340707deed3678454ed4165db0","observation_id":"d1ebc4c2-b695-4d4a-a0a3-88643b99ee76","resolution":{"observed_at":"2026-08-08T17:10:39.740563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02037","last_updated":"2022-02-01T21:32:15Z","snapshot_observed_at":"2026-07-06T11:54:31.182477Z","submitted_at":"2021-10-05T13:36:55Z","title":"Autoregressive Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02037","snapshot_observed_at":"2026-08-08T17:10:39.744140Z","title":"A., Bastings, J., Poole, B., van den Berg, R., and Salimans, T","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-08T17:00:41.319015Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.744140Z"},"links":{"cited_paper":"/paper/2110.02037","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:f26ed76dbf90c407ae99a47dc4b60ee62dd31f056b05da74e4bb005ff17b3b30","observation_id":"7e2421f2-f268-4ed5-a450-08f6fb4d9dc3","resolution":{"observed_at":"2026-08-08T17:10:39.744140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.00630","last_updated":"2023-04-14T00:20:30Z","snapshot_observed_at":"2026-08-03T22:15:47.891015Z","submitted_at":"2021-07-01T17:43:20Z","title":"Variational Diffusion Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.00630","snapshot_observed_at":"2026-08-08T17:10:39.748997Z","title":"P., Salimans, T., Poole, B., and Ho, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-08T17:00:41.319015Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.748997Z"},"links":{"cited_paper":"/paper/2107.00630","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:f828da729278353f79c8c016efeb717191d503ebc35a7d94c3c3db31b8ad20b7","observation_id":"e62cf978-a81a-4b93-abe4-ade911d4ec97","resolution":{"observed_at":"2026-08-08T17:10:39.748997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:10:39.752819Z","title":"H., Gonzalez, J., Zhang, H., and Stoica, I","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-08T17:00:41.319015Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.752819Z"},"links":{"citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:41fc72afc75281832633414b34b353897c4b8f034081bdf91ef59916f7e5ee8b","observation_id":"fb27396a-9ecc-4e2f-a49b-3978f4bd7d2d","resolution":{"observed_at":"2026-08-08T17:10:39.752819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:10:40.319467Z","title":"Coauthor: Designing a human-ai collaborative writing dataset for exploring language model capabilities","venue":null,"work_id":"232551ec-d889-4b8c-aead-5bd8ed3b72c3","year":2022},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-08T17:00:41.319015Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.756278Z"},"links":{"citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:25c3e1e6c6f3e5a3aea39e0498b0e4dab6cddc454f446b2a25d11c3c85c54d75","observation_id":"b886ea01-81ee-45fd-a766-ccd00f46ae64","resolution":{"observed_at":"2026-08-08T17:10:40.323480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.13461","last_updated":"2019-10-29T18:01:00Z","snapshot_observed_at":"2026-07-06T08:33:12.534026Z","submitted_at":"2019-10-29T18:01:00Z","title":"BART: Denoising Sequence-to-Sequence Pre-training for Natural Language Generation, Translation, and Comprehension","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.13461","snapshot_observed_at":"2026-08-08T17:10:39.760569Z","title":"Bart: Denoising sequence-to-sequence pre-training for natural language generation, translation, and comprehension","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-08T17:00:41.319015Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.760569Z"},"links":{"cited_paper":"/paper/1910.13461","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:21b0fdf6336a817afa8e89f95938174edfc4d0ee1e1fd0d29ec22cd48faf7602","observation_id":"92705d52-cb0f-430d-9ecf-6c84ddec48a3","resolution":{"observed_at":"2026-08-08T17:10:39.760569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.03023","last_updated":"2021-06-03T05:26:11Z","snapshot_observed_at":"2026-08-07T05:15:43.777800Z","submitted_at":"2021-05-07T01:19:38Z","title":"DExperts: Decoding-Time Controlled Text Generation with Experts and Anti-Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.03023","snapshot_observed_at":"2026-08-08T17:10:39.764528Z","title":"A., and Choi, Y","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-08T17:00:41.319015Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.764528Z"},"links":{"cited_paper":"/paper/2105.03023","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:41b2ce924f85c57f4d3a6a24a727be7bed0bddf4c910b651f1bdc3d8c14d8882","observation_id":"6c066e2a-a343-4593-8d26-203564067ceb","resolution":{"observed_at":"2026-08-08T17:10:39.764528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01949","last_updated":"2025-03-19T08:34:29Z","snapshot_observed_at":"2026-07-06T19:26:33.330434Z","submitted_at":"2024-10-02T18:51:38Z","title":"Discrete Copula Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01949","snapshot_observed_at":"2026-08-08T17:10:39.767786Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-08T17:00:41.319015Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.767786Z"},"links":{"cited_paper":"/paper/2410.01949","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:60b7b41a6ac132c0a03c9dbd913b6f2873e6ac588e248882c61b215772fc90bd","observation_id":"5de9f587-e63d-415a-8319-08328890cb91","resolution":{"observed_at":"2026-08-08T17:10:39.767786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:10:40.308325Z","title":"Multi-task learning based pre-trained language model for code completion","venue":null,"work_id":"e78d8a68-aada-4421-9020-97f0af0418f1","year":2020},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-08T17:00:41.319015Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.771189Z"},"links":{"citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:a69e9dae6e85752bd3014b34df1b7b3d4e69ac333190a9b536dace5e3c4d3314","observation_id":"d86f4111-c2ca-4400-9506-c771462a25e6","resolution":{"observed_at":"2026-08-08T17:10:40.312183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06264","last_updated":"2025-04-10T01:26:11Z","snapshot_observed_at":"2026-08-05T00:05:28.956802Z","submitted_at":"2024-10-08T18:03:34Z","title":"Think While You Generate: Discrete Diffusion with Planned Denoising","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06264","snapshot_observed_at":"2026-08-08T17:10:39.774186Z","title":"Think while you generate: Discrete diffusion with planned denoising, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-08T17:00:41.319015Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.774186Z"},"links":{"cited_paper":"/paper/2410.06264","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:4d2f2ea34926680a90351b4712636cb699401ac3584cf03b086061435b77611b","observation_id":"c40bb9f5-b970-4f5e-9c2a-72be2c6c62d1","resolution":{"observed_at":"2026-08-08T17:10:39.774186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:10:40.296051Z","title":"Scissorhands: Exploiting the persistence of importance hypothesis for llm kv cache compression at test time","venue":null,"work_id":"925c84fd-47de-44ee-8600-d36cf27e5bac","year":2024},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-08T17:00:41.319015Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.778773Z"},"links":{"citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:2348bd80048afd199658e264789b9868506c663eff884fa2ba38213bb9308e29","observation_id":"5f49b491-0638-4fe5-b7aa-7f6189e74055","resolution":{"observed_at":"2026-08-08T17:10:40.300241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:10:40.284204Z","title":"Discrete diffusion language modeling by estimating the ratios of the data distribution","venue":null,"work_id":"79fa77bc-cfc1-4bf2-9bbb-4e929365b687","year":2023},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-08T17:00:41.319015Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.782296Z"},"links":{"citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:e79c28c2767182900df5a709510a06c8c9ea173f2cd4cc10faf32c57503f7dd7","observation_id":"06bb53cc-98f8-4a9d-aa0d-3a1ef204a551","resolution":{"observed_at":"2026-08-08T17:10:40.288372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:10:40.271515Z","title":null,"venue":null,"work_id":"2479ef70-3ff4-4851-81fb-2b67f569126c","year":2011},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-08T17:00:41.319015Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.786049Z"},"links":{"citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:0c59748e8e3cf900024e85aefdb2d1f626d46f7fff3fea0140f0ad0987161ada","observation_id":"5e549bb7-c074-4fa7-9bc8-89c595d637e7","resolution":{"observed_at":"2026-08-08T17:10:40.275356Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:10:39.789928Z","title":"Pointer sentinel mixture models, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-08T17:00:41.319015Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.789928Z"},"links":{"citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:2f41861de56991b1e9481763414d7a71dbb7cda462e1026c96f2ca5f1bd333da","observation_id":"9143eb05-2bda-4d7d-967a-f69500c7f729","resolution":{"observed_at":"2026-08-08T17:10:39.789928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.07295","last_updated":"2023-03-13T17:17:11Z","snapshot_observed_at":"2026-08-02T13:42:36.172345Z","submitted_at":"2023-03-13T17:17:11Z","title":"Meet in the Middle: A New Pre-training Paradigm","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.07295","snapshot_observed_at":"2026-08-08T17:10:39.794278Z","title":"Meet in the middle: A new pre-training paradigm, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-08T17:00:41.319015Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.794278Z"},"links":{"cited_paper":"/paper/2303.07295","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:eefa0486f5c80b133dd80d1415c2c686ab4cee122e6269b74ce5d4b87e9ae678","observation_id":"0d302c15-0ae8-4383-81bc-c27efeb2e2ff","resolution":{"observed_at":"2026-08-08T17:10:39.794278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18514","last_updated":"2025-02-28T07:02:59Z","snapshot_observed_at":"2026-08-06T04:06:21.906356Z","submitted_at":"2024-10-24T08:01:22Z","title":"Scaling up Masked Diffusion Models on Text","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18514","snapshot_observed_at":"2026-08-08T17:10:39.797937Z","title":"Scaling up masked diffusion models on text, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-08T17:00:41.319015Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.797937Z"},"links":{"cited_paper":"/paper/2410.18514","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:1e6943f931dfb13bfbc0e21c166a4fd376193dad5dedf135f9bfaab891853d37","observation_id":"6eb88fef-74fb-480a-af46-1c9c9499e48d","resolution":{"observed_at":"2026-08-08T17:10:39.797937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03736","last_updated":"2026-03-23T09:46:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-06T04:22:11Z","title":"Your Absorbing Discrete Diffusion Secretly Models the Conditional Distributions of Clean Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03736","snapshot_observed_at":"2026-08-08T17:10:39.801915Z","title":"Your absorbing discrete diffusion secretly models the conditional distributions of clean data, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-08T17:00:41.319015Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.801915Z"},"links":{"cited_paper":"/paper/2406.03736","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:84739326028e3e31273dba8ac1840eb37ef04404752268a9f2ebddb1ef533102","observation_id":"acc9f699-998e-42db-9012-1388bd6c97a9","resolution":{"observed_at":"2026-08-08T17:10:39.801915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06031","last_updated":"2016-06-20T09:37:17Z","snapshot_observed_at":"2026-08-05T16:27:22.031013Z","submitted_at":"2016-06-20T09:37:17Z","title":"The LAMBADA dataset: Word prediction requiring a broad discourse context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06031","snapshot_observed_at":"2026-08-08T17:10:39.805621Z","title":"N., Bernardi, R., Pezzelle, S., Baroni, M., Boleda, G., and Fernández, R","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-08T17:00:41.319015Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.805621Z"},"links":{"cited_paper":"/paper/1606.06031","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:f7fdff6b4694df348f60fbcaaa6d94ca607afa6546f9589499509490f98174d0","observation_id":"28bc4620-320d-40f1-b56c-8b60d4f1b549","resolution":{"observed_at":"2026-08-08T17:10:39.805621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17557","last_updated":"2024-10-31T11:37:49Z","snapshot_observed_at":"2026-08-02T15:25:02.551919Z","submitted_at":"2024-06-25T13:50:56Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17557","snapshot_observed_at":"2026-08-08T17:10:39.809561Z","title":"B., Lozhkov, A., Mitchell, M., Raffel, C., Werra, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-08T17:00:41.319015Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.809561Z"},"links":{"cited_paper":"/paper/2406.17557","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:fa524ae10173b26bafaddad3cec6850bd9ceec958e9965e43f20051f2afdbdb8","observation_id":"32c2ace4-0804-4bff-9f5a-8690dabc4b0a","resolution":{"observed_at":"2026-08-08T17:10:39.809561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:10:39.813372Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-08T17:00:41.319015Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.813372Z"},"links":{"citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:86a01320a92861ca6af4639f30e09dde6c5f37e381adfa1b19089224e7aef6a9","observation_id":"38ef1f46-d3f0-45da-aa88-1124671e7d22","resolution":{"observed_at":"2026-08-08T17:10:39.813372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07524","last_updated":"2024-11-10T20:34:34Z","snapshot_observed_at":"2026-08-05T04:09:52.581952Z","submitted_at":"2024-06-11T17:51:40Z","title":"Simple and Effective Masked Diffusion Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07524","snapshot_observed_at":"2026-08-08T17:10:39.816372Z","title":"S., Arriola, M., Schiff, Y., Gokaslan, A., Marroquin, E., Chiu, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-08T17:00:41.319015Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.816372Z"},"links":{"cited_paper":"/paper/2406.07524","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:51dcbb9e3e79c5b0a10e2fc2fe6843f7e70e0594538d62da2baeb65b3bf03573","observation_id":"025c07d4-cfa7-459f-8ff5-a347b04b23df","resolution":{"observed_at":"2026-08-08T17:10:39.816372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12903","last_updated":"2024-09-20T16:22:37Z","snapshot_observed_at":"2026-08-06T18:35:42.731024Z","submitted_at":"2024-09-19T16:50:26Z","title":"Scaling Smart: Accelerating Large Language Model Pre-training with Small Model Initialization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12903","snapshot_observed_at":"2026-08-08T17:10:39.819680Z","title":"A., Faghri, F., Cho, M., Nabi, M., Naik, D., and Farajtabar, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-08T17:00:41.319015Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.819680Z"},"links":{"cited_paper":"/paper/2409.12903","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:28474414e169ce3e5728844486336669cc1aea52f65e3e76ddedf8fd68a51815","observation_id":"1026cd01-100b-4f3a-8d0a-91fd78437d97","resolution":{"observed_at":"2026-08-08T17:10:39.819680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04823","last_updated":"2024-10-31T16:48:51Z","snapshot_observed_at":"2026-07-06T18:27:03.044022Z","submitted_at":"2024-06-07T10:48:45Z","title":"BERTs are Generative In-Context Learners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04823","snapshot_observed_at":"2026-08-08T17:10:39.822853Z","title":"Berts are generative in-context learners, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-08T17:00:41.319015Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.822853Z"},"links":{"cited_paper":"/paper/2406.04823","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:cd4893904de204c3a892b7e7a9388e9b08bf911cd719b812abb256ad99962bd9","observation_id":"3bb74a02-3c28-4a66-999c-a45a4e69665b","resolution":{"observed_at":"2026-08-08T17:10:39.822853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"cs/0306050","last_updated":"2003-06-12T12:35:00Z","snapshot_observed_at":"2026-08-01T18:48:46.592760Z","submitted_at":"2003-06-12T12:35:00Z","title":"Introduction to the CoNLL-2003 Shared Task: Language-Independent Named Entity Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"cs/0306050","snapshot_observed_at":"2026-08-08T17:10:39.825969Z","title":null,"venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-08T17:00:41.319015Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.825969Z"},"links":{"cited_paper":"/paper/cs/0306050","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:707ff27ddd17d7bda3f4bf22de8df5cfb0038c8ebd2c83992516f59bebffa381","observation_id":"81ac30c0-0010-49de-a9b3-87e796c9129e","resolution":{"observed_at":"2026-08-08T17:10:39.825969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09930","last_updated":"2023-10-15T19:37:39Z","snapshot_observed_at":"2026-08-04T19:27:38.175670Z","submitted_at":"2023-10-15T19:37:39Z","title":"FiLM: Fill-in Language Models for Any-Order Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09930","snapshot_observed_at":"2026-08-08T17:10:39.829805Z","title":"Film: Fill-in language models for any-order generation, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-08T17:00:41.319015Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.829805Z"},"links":{"cited_paper":"/paper/2310.09930","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:905e361c9aff9bd632ed05d3537163ccee26d964f9630e4e425cc19a4f3c3153","observation_id":"da39abf7-16ed-4c1d-b224-23d37adaedd7","resolution":{"observed_at":"2026-08-08T17:10:39.829805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:10:40.246820Z","title":"Long horizon temperature scaling","venue":null,"work_id":"bdb06a8c-1af5-4a24-bcbd-bb169a20762d","year":2023},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-08T17:00:41.319015Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.833475Z"},"links":{"citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:b8acf149403c10d0e1fd0358b145251c454b1616ddf05c0220dcf753fe5fea43","observation_id":"e5b9d0ce-9604-47de-8fee-e56bc88f3b1e","resolution":{"observed_at":"2026-08-08T17:10:40.250448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-08T17:10:39.837397Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-08T17:00:41.319015Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.837397Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:0f2634be4dd2f69716fb960b6ae26dad99f802df593ff1dd49277e3ee1e9ee54","observation_id":"96e8022d-ec5e-44db-9812-ba330e4e52ba","resolution":{"observed_at":"2026-08-08T17:10:39.837397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:10:39.840865Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-08T17:00:41.319015Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.840865Z"},"links":{"citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:0d903bbee2fe0f6b8634c5f163531c602061edfe40e8165134f20e36e602a93e","observation_id":"59df9685-7ca3-4afe-8594-691462055097","resolution":{"observed_at":"2026-08-08T17:10:39.840865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13663","last_updated":"2024-12-19T06:32:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T09:39:44Z","title":"Smarter, Better, Faster, Longer: A Modern Bidirectional Encoder for Fast, Memory Efficient, and Long Context Finetuning and Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13663","snapshot_observed_at":"2026-08-08T17:10:39.844222Z","title":"Smarter, better, faster, longer: A modern bidirectional encoder for fast, memory efficient, and long context finetuning and inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-08T17:00:41.319015Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.844222Z"},"links":{"cited_paper":"/paper/2412.13663","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:715a65593477ee4c1208de87163af94ed63b9925d19a3db0533df2555543d8c9","observation_id":"bd2e9aa9-c568-4098-a642-394e4aa87d57","resolution":{"observed_at":"2026-08-08T17:10:39.844222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18667","last_updated":"2024-02-28T19:23:27Z","snapshot_observed_at":"2026-08-08T06:23:16.006834Z","submitted_at":"2024-02-28T19:23:27Z","title":"FOFO: A Benchmark to Evaluate LLMs' Format-Following Capability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18667","snapshot_observed_at":"2026-08-08T17:10:39.848115Z","title":"Fofo: A benchmark to evaluate llms' format-following capability","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-08T17:00:41.319015Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.848115Z"},"links":{"cited_paper":"/paper/2402.18667","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:cae921e88ec94800b3183bc6cba210e6eac60202cbb61e07b448f8a0488bbb61","observation_id":"449781f1-aa04-4d85-9d85-8fefacf44433","resolution":{"observed_at":"2026-08-08T17:10:39.848115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03275","last_updated":"2024-12-04T12:34:15Z","snapshot_observed_at":"2026-08-05T00:52:19.867112Z","submitted_at":"2024-12-04T12:34:15Z","title":"AntLM: Bridging Causal and Masked Language Models","version":1},"cited_work":{"arxiv_id":"2412.03275","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.03275","snapshot_observed_at":"2026-08-08T17:10:39.925827Z","title":"AntLM: Bridging Causal and Masked Language Models","venue":"cs.CL","work_id":"fa6c9a7e-84a2-43e5-a4f3-149b84a3aea6","year":2024},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-08T17:00:41.319015Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.851945Z"},"links":{"cited_paper":"/paper/2412.03275","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:7cbe89f902afd48d9567c3de0037509a6de901702bdee66e002347cc70ac2229","observation_id":"07fc3082-f54e-4699-8617-996902045114","resolution":{"observed_at":"2026-08-08T17:10:39.931496Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.01626","last_updated":"2016-04-04T02:34:30Z","snapshot_observed_at":"2026-08-07T08:03:58.370822Z","submitted_at":"2015-09-04T22:31:53Z","title":"Character-level Convolutional Networks for Text Classification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.01626","snapshot_observed_at":"2026-08-08T17:10:39.855961Z","title":"Character-level convolutional networks for text classification, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-08T17:00:41.319015Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.855961Z"},"links":{"cited_paper":"/paper/1509.01626","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:48ecdffd3481d1d78f22f5b32d5bc3b45c372f7f9a71d99f9827cca3535f289c","observation_id":"90600637-0f5f-4e81-90aa-9ccd8a3b7a98","resolution":{"observed_at":"2026-08-08T17:10:39.855961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09529","last_updated":"2024-04-15T07:49:10Z","snapshot_observed_at":"2026-07-06T18:00:07.537987Z","submitted_at":"2024-04-15T07:49:10Z","title":"Prepacking: A Simple Method for Fast Prefilling and Increased Throughput in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09529","snapshot_observed_at":"2026-08-08T17:10:39.859709Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-08T17:00:41.319015Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.859709Z"},"links":{"cited_paper":"/paper/2404.09529","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:48c5ab3ba8171b9f72609d08cc1e400272e70cace07e948683e955a859f6b9ad","observation_id":"56c57e3a-696d-4189-b0b7-dea6c0b062c8","resolution":{"observed_at":"2026-08-08T17:10:39.859709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-08T17:10:39.863142Z","title":"X., Zhou, K., Li, J., Tang, T., Wang, X., Hou, Y., Min, Y., Zhang, B., Zhang, J., Dong, Z., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-08T17:00:41.319015Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.863142Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:c8ced56aa6f978119359f8d09376fe135ff7edf1f70807a94c1f111e69f127e6","observation_id":"4658089a-70a2-4a5b-a299-6077e0b480db","resolution":{"observed_at":"2026-08-08T17:10:39.863142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T17:00:41.319015Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":1,"verified_fuzzy":7},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 1 inbound Pith citation observation for arXiv:2502.06901."}