{"as_of":"2026-08-09T16:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:04148210783afd5f819237662c15dbcd29bb402da71222c3841bfe61205fafee","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T17:10:39.863142Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-17T02:05:18.834924Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-17T02:05:18.893265Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-09T13:14:38.685381Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"cited_work":{"arxiv_id":"2502.06901","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06901","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Enabling autoregressive models to fill in masked tokens.arXiv preprint arXiv:2502.06901","venue":null,"work_id":"13eeae4b-700d-4cdb-8c3d-4623c12b4e30","year":2025},"citing_paper":{"arxiv_id":"2506.17298","last_updated":"2025-06-17T17:06:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-17T17:06:18Z","title":"Mercury: Ultra-Fast Language Models Based on Diffusion","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-17T02:05:18.834924Z"},"links":{"cited_paper":"/paper/2502.06901","citing_paper":"/paper/2506.17298"},"observation_digest":"sha256:c7b860397f77019cc769ed5575cd895a4ccffbbf22e0c719174e368fc2189fa9","observation_id":"a569b31d-131c-4fda-9330-69ec8d02b2fa","resolution":{"observed_at":"2026-05-17T02:05:18.895176Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.06901/citation-record","integrity":"/paper/2502.06901/integrity","json":"/paper/2502.06901/citation-record.json","paper":"/paper/2502.06901"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:10:39.679309Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-09T13:14:38.685381Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.679309Z"},"links":{"citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:066f7733d832508490428715d15a0c67f47c63176a2fe9a794a64d35000cf112","observation_id":"45ceeb89-ee0b-437b-8672-b55d2db58788","resolution":{"observed_at":"2026-08-08T17:10:39.679309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-08T17:10:39.683696Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-09T13:14:38.685381Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.683696Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:3108c58330c1b64bfe4f9aeb18d2e896aa22b63786a7158d9ba5d6b0e644d5b6","observation_id":"aa9b1412-ec3b-4e36-9a12-e63d306dff77","resolution":{"observed_at":"2026-08-08T17:10:39.683696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:10:40.362436Z","title":"and Tsitsiklis, J","venue":null,"work_id":"93d8b0c1-964f-4fe7-8105-cb46234b0bf5","year":1993},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-09T13:14:38.685381Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.687735Z"},"links":{"citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:d123b3d76fb6ac8055d44ecf54f00532c9c56c6320fd5a5d89f9106aea9afc2c","observation_id":"e573142e-5f56-4e34-b7c8-e45e4447d3d4","resolution":{"observed_at":"2026-08-08T17:10:40.366042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:10:40.350911Z","title":"One billion word benchmark for measuring progress in statistical language modeling, 2014","venue":null,"work_id":"efa90d4e-8522-47fd-aee4-7b046c2b30f9","year":2014},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-09T13:14:38.685381Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.691337Z"},"links":{"citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:0055e3dcc82528eda3f181a9aab36c0bfc9115571f57b90f2618ee0c8ef6aa4b","observation_id":"01600c16-c573-41cb-a439-fcd9e478fa0d","resolution":{"observed_at":"2026-08-08T17:10:40.355029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04132","last_updated":"2024-03-07T01:22:38Z","snapshot_observed_at":"2026-08-02T17:55:33.750637Z","submitted_at":"2024-03-07T01:22:38Z","title":"Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04132","snapshot_observed_at":"2026-08-08T17:10:39.695329Z","title":"N., Li, T., Li, D., Zhang, H., Zhu, B., Jordan, M., Gonzalez, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-09T13:14:38.685381Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.695329Z"},"links":{"cited_paper":"/paper/2403.04132","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:6a2fe6d4d30e18063528c8b403fc3b14e6078ec13819132017241bc377f0fd83","observation_id":"58e772f8-d8c5-4d81-9a88-57d93e7104db","resolution":{"observed_at":"2026-08-08T17:10:39.695329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:10:39.699400Z","title":"B., Bierbaum, M., O'Keeffe, K","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-09T13:14:38.685381Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.699400Z"},"links":{"citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:7aed53d328bc41a503b6066fecad7f55e264695a2aab0397be3296fa629dc7e1","observation_id":"c4520c0a-6d43-4058-8f5a-7ae5d29b1778","resolution":{"observed_at":"2026-08-08T17:10:39.699400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-08T17:10:39.703116Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-09T13:14:38.685381Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.703116Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:5de58ad84d19f7ddc5d364de4cc59e21177d780986fc3670bbab62a88b642a5d","observation_id":"aa22d8de-870e-4f6b-af3e-971308a88e9a","resolution":{"observed_at":"2026-08-08T17:10:39.703116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.05339","last_updated":"2020-09-10T18:03:11Z","snapshot_observed_at":"2026-08-09T05:50:20.229058Z","submitted_at":"2020-05-11T18:00:03Z","title":"Enabling Language Models to Fill in the Blanks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.05339","snapshot_observed_at":"2026-08-08T17:10:39.707483Z","title":"Enabling language models to fill in the blanks","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-09T13:14:38.685381Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.707483Z"},"links":{"cited_paper":"/paper/2005.05339","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:c039d43e3f9985067c9c48da80ecb38ea8fa8c6ca717755f8445409b72902488","observation_id":"e54ac4dd-2c52-418e-bce5-dc530a7ef369","resolution":{"observed_at":"2026-08-08T17:10:39.707483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.10360","last_updated":"2022-03-17T11:49:55Z","snapshot_observed_at":"2026-07-06T10:51:12.871009Z","submitted_at":"2021-03-18T16:30:26Z","title":"GLM: General Language Model Pretraining with Autoregressive Blank Infilling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.10360","snapshot_observed_at":"2026-08-08T17:10:39.711429Z","title":"Glm: General language model pretraining with autoregressive blank infilling, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-09T13:14:38.685381Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.711429Z"},"links":{"cited_paper":"/paper/2103.10360","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:68846f62b041dfe722b4dd0808eca160c6fd1a7ee416a603eaab5ebf9e41bd55","observation_id":"9a255a77-acb0-4288-bba8-2ddfc9be5f11","resolution":{"observed_at":"2026-08-08T17:10:39.711429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05999","last_updated":"2023-04-09T14:31:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T16:25:26Z","title":"InCoder: A Generative Model for Code Infilling and Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05999","snapshot_observed_at":"2026-08-08T17:10:39.715104Z","title":"Incoder: A generative model for code infilling and synthesis, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-09T13:14:38.685381Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.715104Z"},"links":{"cited_paper":"/paper/2204.05999","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:30794115cbfa061df9dc90daa6a5cf7ab170097f8975bb17a48044f5fda8860f","observation_id":"4242e82c-bb5e-4a14-ace2-bc95bdb7a307","resolution":{"observed_at":"2026-08-08T17:10:39.715104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17891","last_updated":"2025-05-31T07:01:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-23T14:04:22Z","title":"Scaling Diffusion Language Models via Adaptation from Autoregressive Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17891","snapshot_observed_at":"2026-08-08T17:10:39.719321Z","title":"Scaling diffusion language models via adaptation from autoregressive models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-09T13:14:38.685381Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.719321Z"},"links":{"cited_paper":"/paper/2410.17891","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:0c5770a32a4d0d571cfab9fdd001af510878120dd469fbf53f3665318b262f8e","observation_id":"24f7c9a0-1632-4011-acfd-8a875586ff9b","resolution":{"observed_at":"2026-08-08T17:10:39.719321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-08T17:10:39.723058Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-09T13:14:38.685381Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.723058Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:571bae8058c62c9745b7635cc773668e68d5705a3a62f5e5bd38c3d502e939b5","observation_id":"dbbcb1ea-bf3a-4385-8f2c-db9ba5aa9370","resolution":{"observed_at":"2026-08-08T17:10:39.723058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00838","last_updated":"2024-06-07T21:59:52Z","snapshot_observed_at":"2026-07-06T17:23:51.547578Z","submitted_at":"2024-02-01T18:28:55Z","title":"OLMo: Accelerating the Science of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00838","snapshot_observed_at":"2026-08-08T17:10:39.726249Z","title":"H., Ivison, H., Magnusson, I., Wang, Y., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-09T13:14:38.685381Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.726249Z"},"links":{"cited_paper":"/paper/2402.00838","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:640375e9ee6e8f9c6717602a200103826978d86408a159f8d73c2e08d98e3ca2","observation_id":"4eb12ada-59d4-4657-acfb-ffc2535bcd7f","resolution":{"observed_at":"2026-08-08T17:10:39.726249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18619","last_updated":"2023-05-30T16:43:31Z","snapshot_observed_at":"2026-08-03T06:04:27.414689Z","submitted_at":"2023-05-30T16:43:31Z","title":"Likelihood-Based Diffusion Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18619","snapshot_observed_at":"2026-08-08T17:10:39.729397Z","title":"and Hashimoto, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-09T13:14:38.685381Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.729397Z"},"links":{"cited_paper":"/paper/2305.18619","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:3aaae1ecd4aab61850a8ef331d0c81240761bed9653e084e95905197f91dc46b","observation_id":"e193fb6a-9c63-48e5-9e23-47c67a05afbe","resolution":{"observed_at":"2026-08-08T17:10:39.729397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:10:39.732855Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-09T13:14:38.685381Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.732855Z"},"links":{"citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:27fd32a4f494e0e0e47aff50f3a440693c73d54c2da4853ffe2979367dd0e208","observation_id":"48ee7a31-8f0d-411e-9470-6010de50c662","resolution":{"observed_at":"2026-08-08T17:10:39.732855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.11239","last_updated":"2020-12-16T21:15:05Z","snapshot_observed_at":"2026-07-06T09:30:47.469703Z","submitted_at":"2020-06-19T17:24:44Z","title":"Denoising Diffusion Probabilistic Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.11239","snapshot_observed_at":"2026-08-08T17:10:39.736815Z","title":"Denoising diffusion probabilistic models, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-09T13:14:38.685381Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.736815Z"},"links":{"cited_paper":"/paper/2006.11239","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:601922bced910df5cfc3be088f4d34667f0a983a1c3888a61e05b52fe1d56c7a","observation_id":"968eef7d-538b-40c6-9618-97a694d26076","resolution":{"observed_at":"2026-08-08T17:10:39.736815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09751","last_updated":"2020-02-14T21:56:30Z","snapshot_observed_at":"2026-07-06T07:47:32.745963Z","submitted_at":"2019-04-22T07:17:18Z","title":"The Curious Case of Neural Text Degeneration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09751","snapshot_observed_at":"2026-08-08T17:10:39.740563Z","title":"The curious case of neural text degeneration, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-09T13:14:38.685381Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.740563Z"},"links":{"cited_paper":"/paper/1904.09751","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:9324ce4dc139cabfe3beed69274217e495904017658db2510df239a633e3d02f","observation_id":"d1ebc4c2-b695-4d4a-a0a3-88643b99ee76","resolution":{"observed_at":"2026-08-08T17:10:39.740563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02037","last_updated":"2022-02-01T21:32:15Z","snapshot_observed_at":"2026-07-06T11:54:31.182477Z","submitted_at":"2021-10-05T13:36:55Z","title":"Autoregressive Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02037","snapshot_observed_at":"2026-08-08T17:10:39.744140Z","title":"A., Bastings, J., Poole, B., van den Berg, R., and Salimans, T","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-09T13:14:38.685381Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.744140Z"},"links":{"cited_paper":"/paper/2110.02037","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:97a9b3887912ec30988c52ef41f3de11687aa89b27235cbf83dacdefcf21ef68","observation_id":"7e2421f2-f268-4ed5-a450-08f6fb4d9dc3","resolution":{"observed_at":"2026-08-08T17:10:39.744140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.00630","last_updated":"2023-04-14T00:20:30Z","snapshot_observed_at":"2026-08-09T14:29:00.548718Z","submitted_at":"2021-07-01T17:43:20Z","title":"Variational Diffusion Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.00630","snapshot_observed_at":"2026-08-08T17:10:39.748997Z","title":"P., Salimans, T., Poole, B., and Ho, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-09T13:14:38.685381Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.748997Z"},"links":{"cited_paper":"/paper/2107.00630","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:6d402ca695a602c1cdf04f643af7a971a1092e70f85a820e582e719efabbb0a2","observation_id":"e62cf978-a81a-4b93-abe4-ade911d4ec97","resolution":{"observed_at":"2026-08-08T17:10:39.748997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:10:39.752819Z","title":"H., Gonzalez, J., Zhang, H., and Stoica, I","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-09T13:14:38.685381Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.752819Z"},"links":{"citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:815ca1e0fd8b430285411477f0e1ab50c349265a973985437b52193f80682fc2","observation_id":"fb27396a-9ecc-4e2f-a49b-3978f4bd7d2d","resolution":{"observed_at":"2026-08-08T17:10:39.752819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:10:40.319467Z","title":"Coauthor: Designing a human-ai collaborative writing dataset for exploring language model capabilities","venue":null,"work_id":"232551ec-d889-4b8c-aead-5bd8ed3b72c3","year":2022},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-09T13:14:38.685381Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.756278Z"},"links":{"citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:f1d3d98361bd0dbfdfcaacf22824376f93a6acb1eb45813f66b83b0234334872","observation_id":"b886ea01-81ee-45fd-a766-ccd00f46ae64","resolution":{"observed_at":"2026-08-08T17:10:40.323480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.13461","last_updated":"2019-10-29T18:01:00Z","snapshot_observed_at":"2026-07-06T08:33:12.534026Z","submitted_at":"2019-10-29T18:01:00Z","title":"BART: Denoising Sequence-to-Sequence Pre-training for Natural Language Generation, Translation, and Comprehension","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.13461","snapshot_observed_at":"2026-08-08T17:10:39.760569Z","title":"Bart: Denoising sequence-to-sequence pre-training for natural language generation, translation, and comprehension","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-09T13:14:38.685381Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.760569Z"},"links":{"cited_paper":"/paper/1910.13461","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:ff15ede9c2011ff431537d686c35403b680c8bda3de696758c92404f76d8fffa","observation_id":"92705d52-cb0f-430d-9ecf-6c84ddec48a3","resolution":{"observed_at":"2026-08-08T17:10:39.760569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.03023","last_updated":"2021-06-03T05:26:11Z","snapshot_observed_at":"2026-08-07T05:15:43.777800Z","submitted_at":"2021-05-07T01:19:38Z","title":"DExperts: Decoding-Time Controlled Text Generation with Experts and Anti-Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.03023","snapshot_observed_at":"2026-08-08T17:10:39.764528Z","title":"A., and Choi, Y","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-09T13:14:38.685381Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.764528Z"},"links":{"cited_paper":"/paper/2105.03023","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:747e94179dd129380ea7c267c3db152f576e7692b8ebb44e93cbe1bc6ec5fce5","observation_id":"6c066e2a-a343-4593-8d26-203564067ceb","resolution":{"observed_at":"2026-08-08T17:10:39.764528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01949","last_updated":"2025-03-19T08:34:29Z","snapshot_observed_at":"2026-07-06T19:26:33.330434Z","submitted_at":"2024-10-02T18:51:38Z","title":"Discrete Copula Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01949","snapshot_observed_at":"2026-08-08T17:10:39.767786Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-09T13:14:38.685381Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.767786Z"},"links":{"cited_paper":"/paper/2410.01949","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:9a834f2c1ff81ff69813b2877b8b1ae13567da2965ab15f5c634b00115c9e413","observation_id":"5de9f587-e63d-415a-8319-08328890cb91","resolution":{"observed_at":"2026-08-08T17:10:39.767786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:10:40.308325Z","title":"Multi-task learning based pre-trained language model for code completion","venue":null,"work_id":"e78d8a68-aada-4421-9020-97f0af0418f1","year":2020},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-09T13:14:38.685381Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.771189Z"},"links":{"citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:a1fde5d6e6ebed1455883eb369fe83b6128a8487e266e4e12ec2c5cd2886c8d8","observation_id":"d86f4111-c2ca-4400-9506-c771462a25e6","resolution":{"observed_at":"2026-08-08T17:10:40.312183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06264","last_updated":"2025-04-10T01:26:11Z","snapshot_observed_at":"2026-08-09T13:14:20.402647Z","submitted_at":"2024-10-08T18:03:34Z","title":"Think While You Generate: Discrete Diffusion with Planned Denoising","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06264","snapshot_observed_at":"2026-08-08T17:10:39.774186Z","title":"Think while you generate: Discrete diffusion with planned denoising, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-09T13:14:38.685381Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.774186Z"},"links":{"cited_paper":"/paper/2410.06264","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:9435ba9ef1c1e3ae4dfc2634248b517956e29d6ac098cff9d6389954ca2680d4","observation_id":"c40bb9f5-b970-4f5e-9c2a-72be2c6c62d1","resolution":{"observed_at":"2026-08-08T17:10:39.774186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:10:40.296051Z","title":"Scissorhands: Exploiting the persistence of importance hypothesis for llm kv cache compression at test time","venue":null,"work_id":"925c84fd-47de-44ee-8600-d36cf27e5bac","year":2024},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-09T13:14:38.685381Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.778773Z"},"links":{"citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:823b5382e3a9cfc55d218fcf38b65bbcc728a185ce6468f10200050b87359874","observation_id":"5f49b491-0638-4fe5-b7aa-7f6189e74055","resolution":{"observed_at":"2026-08-08T17:10:40.300241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:10:40.284204Z","title":"Discrete diffusion language modeling by estimating the ratios of the data distribution","venue":null,"work_id":"79fa77bc-cfc1-4bf2-9bbb-4e929365b687","year":2023},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-09T13:14:38.685381Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.782296Z"},"links":{"citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:b6b320a3eddeb994fd9b8ad3391308700e0fc8db64fecb5a32cf2e1380895f55","observation_id":"06bb53cc-98f8-4a9d-aa0d-3a1ef204a551","resolution":{"observed_at":"2026-08-08T17:10:40.288372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:10:40.271515Z","title":null,"venue":null,"work_id":"2479ef70-3ff4-4851-81fb-2b67f569126c","year":2011},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-09T13:14:38.685381Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.786049Z"},"links":{"citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:6f638dfd34aad59ac404a7b3400927b7f50a134f50ab00fcd66259a715fd8437","observation_id":"5e549bb7-c074-4fa7-9bc8-89c595d637e7","resolution":{"observed_at":"2026-08-08T17:10:40.275356Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:10:39.789928Z","title":"Pointer sentinel mixture models, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-09T13:14:38.685381Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.789928Z"},"links":{"citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:626e16b75822966a4ed7c5215fc6136f7bb14f3e9e4e7e6f0d2a2fd6987ca8ac","observation_id":"9143eb05-2bda-4d7d-967a-f69500c7f729","resolution":{"observed_at":"2026-08-08T17:10:39.789928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.07295","last_updated":"2023-03-13T17:17:11Z","snapshot_observed_at":"2026-08-02T13:42:36.172345Z","submitted_at":"2023-03-13T17:17:11Z","title":"Meet in the Middle: A New Pre-training Paradigm","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.07295","snapshot_observed_at":"2026-08-08T17:10:39.794278Z","title":"Meet in the middle: A new pre-training paradigm, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-09T13:14:38.685381Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.794278Z"},"links":{"cited_paper":"/paper/2303.07295","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:743d46fba9a89ed2b9324911e59effa1b8eaf934b3ab8ce613781ce00985fd51","observation_id":"0d302c15-0ae8-4383-81bc-c27efeb2e2ff","resolution":{"observed_at":"2026-08-08T17:10:39.794278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18514","last_updated":"2025-02-28T07:02:59Z","snapshot_observed_at":"2026-08-06T04:06:21.906356Z","submitted_at":"2024-10-24T08:01:22Z","title":"Scaling up Masked Diffusion Models on Text","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18514","snapshot_observed_at":"2026-08-08T17:10:39.797937Z","title":"Scaling up masked diffusion models on text, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-09T13:14:38.685381Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.797937Z"},"links":{"cited_paper":"/paper/2410.18514","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:e06b54e45e9821f4397930c08f79d7f895a97217542cd3ba665322d47efacdef","observation_id":"6eb88fef-74fb-480a-af46-1c9c9499e48d","resolution":{"observed_at":"2026-08-08T17:10:39.797937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03736","last_updated":"2026-03-23T09:46:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-06T04:22:11Z","title":"Your Absorbing Discrete Diffusion Secretly Models the Conditional Distributions of Clean Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03736","snapshot_observed_at":"2026-08-08T17:10:39.801915Z","title":"Your absorbing discrete diffusion secretly models the conditional distributions of clean data, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-09T13:14:38.685381Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.801915Z"},"links":{"cited_paper":"/paper/2406.03736","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:6a8233910ede2f8128d129676e979b597414848256a04e11097faf429a20069d","observation_id":"acc9f699-998e-42db-9012-1388bd6c97a9","resolution":{"observed_at":"2026-08-08T17:10:39.801915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06031","last_updated":"2016-06-20T09:37:17Z","snapshot_observed_at":"2026-08-05T16:27:22.031013Z","submitted_at":"2016-06-20T09:37:17Z","title":"The LAMBADA dataset: Word prediction requiring a broad discourse context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06031","snapshot_observed_at":"2026-08-08T17:10:39.805621Z","title":"N., Bernardi, R., Pezzelle, S., Baroni, M., Boleda, G., and Fernández, R","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-09T13:14:38.685381Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.805621Z"},"links":{"cited_paper":"/paper/1606.06031","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:0f45570e10d25fa41ef79400cbc3da500d18f3749c814858e2133f0306bec37c","observation_id":"28bc4620-320d-40f1-b56c-8b60d4f1b549","resolution":{"observed_at":"2026-08-08T17:10:39.805621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17557","last_updated":"2024-10-31T11:37:49Z","snapshot_observed_at":"2026-08-02T15:25:02.551919Z","submitted_at":"2024-06-25T13:50:56Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17557","snapshot_observed_at":"2026-08-08T17:10:39.809561Z","title":"B., Lozhkov, A., Mitchell, M., Raffel, C., Werra, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-09T13:14:38.685381Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.809561Z"},"links":{"cited_paper":"/paper/2406.17557","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:29827e5b348874533db278f8ee7c8e1ee708bcba39213d2d080e53372d0b12d3","observation_id":"32c2ace4-0804-4bff-9f5a-8690dabc4b0a","resolution":{"observed_at":"2026-08-08T17:10:39.809561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:10:39.813372Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-09T13:14:38.685381Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.813372Z"},"links":{"citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:166661ddc184609eddf6db72f30c2673bd163723a1ddf745dd01b60579c1c3d4","observation_id":"38ef1f46-d3f0-45da-aa88-1124671e7d22","resolution":{"observed_at":"2026-08-08T17:10:39.813372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07524","last_updated":"2024-11-10T20:34:34Z","snapshot_observed_at":"2026-08-05T04:09:52.581952Z","submitted_at":"2024-06-11T17:51:40Z","title":"Simple and Effective Masked Diffusion Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07524","snapshot_observed_at":"2026-08-08T17:10:39.816372Z","title":"S., Arriola, M., Schiff, Y., Gokaslan, A., Marroquin, E., Chiu, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-09T13:14:38.685381Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.816372Z"},"links":{"cited_paper":"/paper/2406.07524","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:e1dcbf46eec6a0a47066712e0bed2d18d96c1bad2084e87dcd1cff856830a642","observation_id":"025c07d4-cfa7-459f-8ff5-a347b04b23df","resolution":{"observed_at":"2026-08-08T17:10:39.816372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12903","last_updated":"2024-09-20T16:22:37Z","snapshot_observed_at":"2026-08-06T18:35:42.731024Z","submitted_at":"2024-09-19T16:50:26Z","title":"Scaling Smart: Accelerating Large Language Model Pre-training with Small Model Initialization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12903","snapshot_observed_at":"2026-08-08T17:10:39.819680Z","title":"A., Faghri, F., Cho, M., Nabi, M., Naik, D., and Farajtabar, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-09T13:14:38.685381Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.819680Z"},"links":{"cited_paper":"/paper/2409.12903","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:2e92f238637676ee738f4ab5d5c0181b5a92b3c9d4c05e05971e0084f4a0bf22","observation_id":"1026cd01-100b-4f3a-8d0a-91fd78437d97","resolution":{"observed_at":"2026-08-08T17:10:39.819680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04823","last_updated":"2024-10-31T16:48:51Z","snapshot_observed_at":"2026-08-09T16:32:45.355541Z","submitted_at":"2024-06-07T10:48:45Z","title":"BERTs are Generative In-Context Learners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04823","snapshot_observed_at":"2026-08-08T17:10:39.822853Z","title":"Berts are generative in-context learners, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-09T13:14:38.685381Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.822853Z"},"links":{"cited_paper":"/paper/2406.04823","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:2d30139d333068a13cdc1e53bba029519c50143c6d0a8e6f3a287b0da3289383","observation_id":"3bb74a02-3c28-4a66-999c-a45a4e69665b","resolution":{"observed_at":"2026-08-08T17:10:39.822853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"cs/0306050","last_updated":"2003-06-12T12:35:00Z","snapshot_observed_at":"2026-08-01T18:48:46.592760Z","submitted_at":"2003-06-12T12:35:00Z","title":"Introduction to the CoNLL-2003 Shared Task: Language-Independent Named Entity Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"cs/0306050","snapshot_observed_at":"2026-08-08T17:10:39.825969Z","title":null,"venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-09T13:14:38.685381Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.825969Z"},"links":{"cited_paper":"/paper/cs/0306050","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:46e303077273a4265537f34777cb2a8c8d5cafbc6c9d890877833f1c2edb57fb","observation_id":"81ac30c0-0010-49de-a9b3-87e796c9129e","resolution":{"observed_at":"2026-08-08T17:10:39.825969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09930","last_updated":"2023-10-15T19:37:39Z","snapshot_observed_at":"2026-08-04T19:27:38.175670Z","submitted_at":"2023-10-15T19:37:39Z","title":"FiLM: Fill-in Language Models for Any-Order Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09930","snapshot_observed_at":"2026-08-08T17:10:39.829805Z","title":"Film: Fill-in language models for any-order generation, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-09T13:14:38.685381Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.829805Z"},"links":{"cited_paper":"/paper/2310.09930","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:6a2efb3368e4be989ef5a1f9a215996c0ce3b914c7914a44b2ccd4586d1b9d74","observation_id":"da39abf7-16ed-4c1d-b224-23d37adaedd7","resolution":{"observed_at":"2026-08-08T17:10:39.829805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:10:40.246820Z","title":"Long horizon temperature scaling","venue":null,"work_id":"bdb06a8c-1af5-4a24-bcbd-bb169a20762d","year":2023},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-09T13:14:38.685381Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.833475Z"},"links":{"citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:c339c060ed881e626c54dedc5d0aeecf68154dd343c2d2748a8177d53ae480c1","observation_id":"e5b9d0ce-9604-47de-8fee-e56bc88f3b1e","resolution":{"observed_at":"2026-08-08T17:10:40.250448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-08T17:10:39.837397Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-09T13:14:38.685381Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.837397Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:d1fdd4d22bacea5d58f07454b04c26c9aaca116112fa2abf79b678768c7ee8ee","observation_id":"96e8022d-ec5e-44db-9812-ba330e4e52ba","resolution":{"observed_at":"2026-08-08T17:10:39.837397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T17:10:39.840865Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-09T13:14:38.685381Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.840865Z"},"links":{"citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:a59f6b8f14d0f228276286e41fc98da35082bb9a7fa68b42315ad4b45a72f1e0","observation_id":"59df9685-7ca3-4afe-8594-691462055097","resolution":{"observed_at":"2026-08-08T17:10:39.840865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13663","last_updated":"2024-12-19T06:32:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T09:39:44Z","title":"Smarter, Better, Faster, Longer: A Modern Bidirectional Encoder for Fast, Memory Efficient, and Long Context Finetuning and Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13663","snapshot_observed_at":"2026-08-08T17:10:39.844222Z","title":"Smarter, better, faster, longer: A modern bidirectional encoder for fast, memory efficient, and long context finetuning and inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-09T13:14:38.685381Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.844222Z"},"links":{"cited_paper":"/paper/2412.13663","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:b20a19a20f15e0af4d58f6d3f319c7305fbd2b5ae83ad51bec24582708e36716","observation_id":"bd2e9aa9-c568-4098-a642-394e4aa87d57","resolution":{"observed_at":"2026-08-08T17:10:39.844222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18667","last_updated":"2024-02-28T19:23:27Z","snapshot_observed_at":"2026-08-08T06:23:16.006834Z","submitted_at":"2024-02-28T19:23:27Z","title":"FOFO: A Benchmark to Evaluate LLMs' Format-Following Capability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18667","snapshot_observed_at":"2026-08-08T17:10:39.848115Z","title":"Fofo: A benchmark to evaluate llms' format-following capability","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-09T13:14:38.685381Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.848115Z"},"links":{"cited_paper":"/paper/2402.18667","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:2629597ef5686bfaa680a7b42c96cb190ab95790672ea4fa510a67cbaf7479d7","observation_id":"449781f1-aa04-4d85-9d85-8fefacf44433","resolution":{"observed_at":"2026-08-08T17:10:39.848115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03275","last_updated":"2024-12-04T12:34:15Z","snapshot_observed_at":"2026-08-05T00:52:19.867112Z","submitted_at":"2024-12-04T12:34:15Z","title":"AntLM: Bridging Causal and Masked Language Models","version":1},"cited_work":{"arxiv_id":"2412.03275","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.03275","snapshot_observed_at":"2026-08-08T17:10:39.925827Z","title":"AntLM: Bridging Causal and Masked Language Models","venue":"cs.CL","work_id":"fa6c9a7e-84a2-43e5-a4f3-149b84a3aea6","year":2024},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-09T13:14:38.685381Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.851945Z"},"links":{"cited_paper":"/paper/2412.03275","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:f13ef57bc3d752129e169442f86acea39eba82a0bb584873fe3ecef1dd032161","observation_id":"07fc3082-f54e-4699-8617-996902045114","resolution":{"observed_at":"2026-08-08T17:10:39.931496Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.01626","last_updated":"2016-04-04T02:34:30Z","snapshot_observed_at":"2026-08-07T08:03:58.370822Z","submitted_at":"2015-09-04T22:31:53Z","title":"Character-level Convolutional Networks for Text Classification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.01626","snapshot_observed_at":"2026-08-08T17:10:39.855961Z","title":"Character-level convolutional networks for text classification, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-09T13:14:38.685381Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.855961Z"},"links":{"cited_paper":"/paper/1509.01626","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:fd9f2ffab6266898d36c6de382bed2ce1f2800e2d0f41873231f9b14c5e5809a","observation_id":"90600637-0f5f-4e81-90aa-9ccd8a3b7a98","resolution":{"observed_at":"2026-08-08T17:10:39.855961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09529","last_updated":"2024-04-15T07:49:10Z","snapshot_observed_at":"2026-07-06T18:00:07.537987Z","submitted_at":"2024-04-15T07:49:10Z","title":"Prepacking: A Simple Method for Fast Prefilling and Increased Throughput in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09529","snapshot_observed_at":"2026-08-08T17:10:39.859709Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-09T13:14:38.685381Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.859709Z"},"links":{"cited_paper":"/paper/2404.09529","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:0f91b0833d28cd62eb4ecc2023d500e545baaf1f79f046b5bd4c4a44be4836e9","observation_id":"56c57e3a-696d-4189-b0b7-dea6c0b062c8","resolution":{"observed_at":"2026-08-08T17:10:39.859709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-08T17:10:39.863142Z","title":"X., Zhou, K., Li, J., Tang, T., Wang, X., Hou, Y., Min, Y., Zhang, B., Zhang, J., Dong, Z., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","snapshot_observed_at":"2026-08-09T13:14:38.685381Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-08T17:10:39.863142Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2502.06901"},"observation_digest":"sha256:a2b1a09b9f641ce3b5796e6b09d08610a1590b556d602fa2a58f0a44f8a1804b","observation_id":"4658089a-70a2-4a5b-a299-6077e0b480db","resolution":{"observed_at":"2026-08-08T17:10:39.863142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.06901","last_updated":"2025-02-09T20:02:05Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T13:14:38.685381Z","submitted_at":"2025-02-09T20:02:05Z","title":"Enabling Autoregressive Models to Fill In Masked Tokens"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":1,"verified_fuzzy":7},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 1 inbound Pith citation observation for arXiv:2502.06901."}