{"as_of":"2026-08-12T12:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ad231d27fb11fb6c7ab7499e6823d52ff5c9d5e1bb2325e1251d3c1e051839eb","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:39:06.681448Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T20:15:16.805001Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T20:46:14.278414Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18456","snapshot_observed_at":"2026-08-05T20:15:16.805001Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10875","last_updated":"2026-06-04T15:16:30Z","snapshot_observed_at":"2026-08-05T20:14:58.845639Z","submitted_at":"2025-08-14T17:47:22Z","title":"A Survey on Diffusion Language Models","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T20:15:16.805001Z"},"links":{"cited_paper":"/paper/2505.18456","citing_paper":"/paper/2508.10875"},"observation_digest":"sha256:a59e4f7859e3cf43ae2a5f76b778c1d3fc61b018df8125da2faecccbec551683","observation_id":"5512026d-d41a-443f-ade3-0fabd8784bef","resolution":{"observed_at":"2026-08-05T20:15:16.805001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18456","snapshot_observed_at":"2026-08-05T13:20:05.355680Z","title":"Anchored diffusion language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01025","last_updated":"2025-09-07T22:48:13Z","snapshot_observed_at":"2026-08-06T04:06:34.224683Z","submitted_at":"2025-08-31T23:34:53Z","title":"Any-Order Flexible Length Masked Diffusion","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T13:20:05.355680Z"},"links":{"cited_paper":"/paper/2505.18456","citing_paper":"/paper/2509.01025"},"observation_digest":"sha256:9300e9577f3e963dcf00082da8ec9583ba70026a7913fefef0aa1b9e45ec5bde","observation_id":"76a6718c-3712-4070-94ae-99d94950cdb0","resolution":{"observed_at":"2026-08-05T13:20:05.355680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18456","snapshot_observed_at":"2026-08-04T13:15:31.739567Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.01384","last_updated":"2026-05-22T19:48:31Z","snapshot_observed_at":"2026-08-09T16:34:10.718069Z","submitted_at":"2025-10-01T19:15:25Z","title":"Fine-Tuning Masked Diffusion for Provable Self-Correction","version":4},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-04T13:15:31.739567Z"},"links":{"cited_paper":"/paper/2505.18456","citing_paper":"/paper/2510.01384"},"observation_digest":"sha256:d5c14754e3a0cbeb9697ebc5feb80734adf38dac9be7ac3158cb3ebd484ecad6","observation_id":"98138791-d3ff-4bb0-9903-83f93e5f0495","resolution":{"observed_at":"2026-08-04T13:15:31.739567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"cited_work":{"arxiv_id":"2505.18456","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18456","snapshot_observed_at":"2026-07-01T20:46:14.278414Z","title":"Anchored diffu- sion language model.arXiv preprint arXiv:2505.18456","venue":null,"work_id":"ef21e3d3-47f3-4d30-804b-0b7dfcf24b06","year":2025},"citing_paper":{"arxiv_id":"2602.16169","last_updated":"2026-05-20T20:41:06Z","snapshot_observed_at":"2026-07-06T22:46:17.123722Z","submitted_at":"2026-02-18T04:05:40Z","title":"Discrete Stochastic Localization for Non-autoregressive Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-22T11:36:24.506077Z"},"links":{"cited_paper":"/paper/2505.18456","citing_paper":"/paper/2602.16169"},"observation_digest":"sha256:f4dfe0d161c34f1eb7a6704ee7c5d5748520c55b35297022b3706b86ae6f12f5","observation_id":"710b71cf-b638-4670-a564-36bfa08915ac","resolution":{"observed_at":"2026-05-22T11:36:28.954199Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"cited_work":{"arxiv_id":"2505.18456","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18456","snapshot_observed_at":"2026-07-01T20:46:14.278414Z","title":"Anchored diffu- sion language model.arXiv preprint arXiv:2505.18456","venue":null,"work_id":"ef21e3d3-47f3-4d30-804b-0b7dfcf24b06","year":2025},"citing_paper":{"arxiv_id":"2605.12836","last_updated":"2026-05-20T20:19:39Z","snapshot_observed_at":"2026-07-06T23:24:27.821980Z","submitted_at":"2026-05-13T00:12:24Z","title":"Discrete Stochastic Localization for Non-autoregressive Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-14T20:45:54.863655Z"},"links":{"cited_paper":"/paper/2505.18456","citing_paper":"/paper/2605.12836"},"observation_digest":"sha256:a0cebd9401f48f646e3769bfe22208556fa83e0bc0bce430924b60d8af52fe4e","observation_id":"5d124acd-12a4-473e-b721-cbdfd00e0c33","resolution":{"observed_at":"2026-05-14T20:47:58.428582Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"cited_work":{"arxiv_id":"2505.18456","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18456","snapshot_observed_at":"2026-07-01T20:46:14.278414Z","title":"Anchored diffu- sion language model.arXiv preprint arXiv:2505.18456","venue":null,"work_id":"ef21e3d3-47f3-4d30-804b-0b7dfcf24b06","year":2025},"citing_paper":{"arxiv_id":"2606.01024","last_updated":"2026-05-31T05:27:01Z","snapshot_observed_at":"2026-08-06T19:38:02.696107Z","submitted_at":"2026-05-31T05:27:01Z","title":"DSL-LLaDA: Scaling Continuous Denoising to 8B Masked Diffusion LMs","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-28T17:39:11.170970Z"},"links":{"cited_paper":"/paper/2505.18456","citing_paper":"/paper/2606.01024"},"observation_digest":"sha256:24afd5eb9cc8282cebe5b48b4f9a4a047c61097b9c24a9f333526a1e68f26ac2","observation_id":"0e4092a3-c70b-4d7b-b303-7781e75e1e54","resolution":{"observed_at":"2026-07-01T20:46:14.279785Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18456","snapshot_observed_at":"2026-08-01T14:25:40.569444Z","title":"arXiv preprint arXiv:2505.18456 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26504","last_updated":"2026-08-09T19:34:25Z","snapshot_observed_at":"2026-08-12T11:20:16.592609Z","submitted_at":"2026-07-29T06:09:12Z","title":"From Interface to Inference: Eliciting Any-Order Inference from Any-Order Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-01T14:25:40.569444Z"},"links":{"cited_paper":"/paper/2505.18456","citing_paper":"/paper/2607.26504"},"observation_digest":"sha256:ca844c1efa031dd0ded9988dd4eacc8089a60955408a4121a01fba3a0007cb26","observation_id":"3ebc75e4-5bf4-488f-b59e-58850309c538","resolution":{"observed_at":"2026-08-01T14:25:40.569444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.18456/citation-record","integrity":"/paper/2505.18456/integrity","json":"/paper/2505.18456/citation-record.json","paper":"/paper/2505.18456"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:13.777378Z","title":"The claude 3 model family: Opus, sonnet, haiku","venue":null,"work_id":"9760bba9-f34d-46e0-8021-893fedb58b69","year":2024},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T14:38:58.965039Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:d271c72cb3b62d1d8d7322eb8cd7e2d60657d396d24e14e3f1543d42036c5d52","observation_id":"8ce6cb26-551e-455f-a5d5-49119d6a7ef7","resolution":{"observed_at":"2026-08-07T14:39:13.879220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:38:59.036768Z","title":"Block diffusion: Interpolating between autoregressive and diffusion language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T14:38:59.036768Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:3272c6453a09866cfce64d6e550317dc5b38ee1c3448e9030ebad6915d4bde60","observation_id":"b1bb3506-e19b-4d4d-8151-510d0fa0130a","resolution":{"observed_at":"2026-08-07T14:38:59.036768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:13.489087Z","title":"Johnson, Jonathan Ho, Daniel Tarlow, and Rianne van den Berg","venue":null,"work_id":"b293d88a-4171-48eb-8bc5-3511bb115edf","year":2021},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T14:38:59.167895Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:76bfc79e56d18871a3d19d9531b40c7ee77b842646f00381cc36e77726aca347","observation_id":"ff08b4e7-0388-41cc-91b2-1200997783c2","resolution":{"observed_at":"2026-08-07T14:39:13.631420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:13.241844Z","title":"A neural probabilistic language model","venue":null,"work_id":"516a5320-ca64-413c-afc6-950d2e0996b9","year":2003},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T14:38:59.283765Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:ca35aee031250613513a95f311f77c5022f94ffffed6f9878a3bc18004048d04","observation_id":"cc57b84e-24e3-40ea-8834-ebc3b7ff25b9","resolution":{"observed_at":"2026-08-07T14:39:13.360816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:13.010764Z","title":"Language models are few-shot learners","venue":null,"work_id":"3fef2521-8a24-4321-8459-cb7ebc064c60","year":1901},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T14:38:59.384307Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:3d3c29a9bf65bac67dc6e84036184dbdd31ec1aa7d48770eff0de475fa59ef0b","observation_id":"81891a66-8540-45eb-b175-327041b1a0b2","resolution":{"observed_at":"2026-08-07T14:39:13.094828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:12.770234Z","title":"Brown, Benjamin Mann, Nick Ryder, Melanie Subbiah, Jared Kaplan, Prafulla Dhariwal, Arvind Neelakantan, Pranav Shyam, Girish Sastry, Amanda Askell, et al","venue":null,"work_id":"89d4338d-a3fa-4df7-a814-3a85b2c54ed3","year":1901},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T14:38:59.491670Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:c484051e92b19e3ec271723beb346a49cd6d2b45a436b7e830ba7cc4be15ddc8","observation_id":"35e57478-4f96-48e0-aac6-7f9a88f8fd39","resolution":{"observed_at":"2026-08-07T14:39:12.874152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:12.546439Z","title":"A continuous time framework for discrete denoising models","venue":null,"work_id":"380571fb-dc1e-4e8b-a06e-c39c82aca373","year":2022},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T14:38:59.603802Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:10d203f5552d4c4bd9fab8a48f2cc8c52e1c7a3eb8713791cff7f3b7763fc9ed","observation_id":"8af44e27-6b6c-4645-9299-16e0d75906aa","resolution":{"observed_at":"2026-08-07T14:39:12.661708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.3005","last_updated":"2014-03-04T18:30:26Z","snapshot_observed_at":"2026-08-05T11:04:54.095339Z","submitted_at":"2013-12-11T00:25:57Z","title":"One Billion Word Benchmark for Measuring Progress in Statistical Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.3005","snapshot_observed_at":"2026-08-07T14:38:59.750300Z","title":"One billion word benchmark for measuring progress in statistical language modeling","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T14:38:59.750300Z"},"links":{"cited_paper":"/paper/1312.3005","citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:369c61395d32b8be0740b78ba42dba4980fabbd7d5194e0556b26b7f9d6510d0","observation_id":"8f049e08-84ba-4c18-815c-bb1dca98347f","resolution":{"observed_at":"2026-08-07T14:38:59.750300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:12.303883Z","title":"What does bert look at? an analysis of bert’s attention","venue":null,"work_id":"7a10dcc4-b64f-46d4-b387-0d1375be0f9a","year":2019},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T14:38:59.864579Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:316c5c82998443b87189f3ffaefe616e46a53b708453764ff32022cf16f211ce","observation_id":"037a33cf-2f88-4974-8bc1-e460bc001008","resolution":{"observed_at":"2026-08-07T14:39:12.408545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T14:38:59.998900Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T14:38:59.998900Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:57a03e4c4e38071a3e72a7fe705ef03ee012b8e813a8b3f880f76d57f6924cd1","observation_id":"fa02e8c1-7dd9-44fd-96e4-55f0f141745b","resolution":{"observed_at":"2026-08-07T14:38:59.998900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:12.041520Z","title":"A discourse-aware attention model for abstractive summarization of long documents","venue":null,"work_id":"405f1d21-90fd-4542-a31d-9be86c939bce","year":2018},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:00.130743Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:ba7b85ccb150d82f99eabbc844970642ae9f4a4a86342de7d28fc7be9474a28f","observation_id":"06f5ca7c-9c2b-4507-ac30-4667e36e161d","resolution":{"observed_at":"2026-08-07T14:39:12.158053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:11.737127Z","title":"Transformer-xl: Attentive language models beyond a fixed-length context","venue":null,"work_id":"8e519862-9e0a-43a6-b0ce-786e71bedf67","year":2019},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:00.263743Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:43e43ce6fcba11b53871a117e1eba055e25c0fad801ddf8adcfaca4d88084b50","observation_id":"8f4ccba6-6bec-4dbc-a250-3aa4af905e41","resolution":{"observed_at":"2026-08-07T14:39:11.891851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:00.380299Z","title":"Maximum likelihood from incomplete data via the em algorithm","venue":null,"work_id":null,"year":1977},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:00.380299Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:2959e855db351c27b23924bdbce58ef886813e48ac5bc790e379c6354c4e512b","observation_id":"0c433977-63d8-4822-a18b-ff12c195ed25","resolution":{"observed_at":"2026-08-07T14:39:00.380299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14838","last_updated":"2024-05-23T17:54:14Z","snapshot_observed_at":"2026-07-06T18:18:51.814306Z","submitted_at":"2024-05-23T17:54:14Z","title":"From Explicit CoT to Implicit CoT: Learning to Internalize CoT Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14838","snapshot_observed_at":"2026-08-07T14:39:00.510403Z","title":"From explicit cot to implicit cot: Learning to internalize cot step by step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:00.510403Z"},"links":{"cited_paper":"/paper/2405.14838","citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:e73b5a8b4267f5df3921d1a37d61891984de15e3845ca3077134dd7ea66526fd","observation_id":"8af0f5d5-6d4a-4931-8ef2-6e2bed1b5294","resolution":{"observed_at":"2026-08-07T14:39:00.510403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:00.638726Z","title":"Hierarchical neural story generation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:00.638726Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:dbc2ea508f90c125361d16834f06669808e16f2f9b2efafec6687b31159e2cb7","observation_id":"17de1736-4bef-409e-89ab-df0d31db9acf","resolution":{"observed_at":"2026-08-07T14:39:00.638726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:11.506698Z","title":null,"venue":null,"work_id":"c28a50e1-b335-41f5-af33-3c55ab379572","year":2024},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:00.745092Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:a04a9a802f4ae4e8409610cca65ace3d008697b09cdbf9e4ddbaa7ac1e97fa5f","observation_id":"76fb7c70-f37e-4c06-b2ae-96f846c8e646","resolution":{"observed_at":"2026-08-07T14:39:11.608600Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:00.928402Z","title":"Openwebtext corpus","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:00.928402Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:67a8aa98b796633d1024b96d94f1b8d55cfde4472dbd1603676f424109bfb5cb","observation_id":"3d5c6c26-b2cb-49da-af73-d0185d91a937","resolution":{"observed_at":"2026-08-07T14:39:00.928402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:01.064162Z","title":"Think before you speak: Training language models with pause tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:01.064162Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:8e7e5f9f4b124a0eeabf4e76831b4b6f60f58d417b4c4f3d4bfac9e73c205a82","observation_id":"fe14b957-2fdf-4166-b4dc-c4a87108df83","resolution":{"observed_at":"2026-08-07T14:39:01.064162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:11.196440Z","title":"Likelihood-based diffusion language models","venue":null,"work_id":"738a6d1f-c0cd-48fc-bd86-5c2e1d9b9f19","year":2023},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:01.168780Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:f56844ee1ba1e3e8fa2fac6c81ee01838a091e244f21fc599e37203440b200b5","observation_id":"3e279421-604b-4a84-b640-52d5354052e1","resolution":{"observed_at":"2026-08-07T14:39:11.339861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06769","last_updated":"2025-11-03T00:53:34Z","snapshot_observed_at":"2026-08-07T06:05:27.895209Z","submitted_at":"2024-12-09T18:55:56Z","title":"Training Large Language Models to Reason in a Continuous Latent Space","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06769","snapshot_observed_at":"2026-08-07T14:39:01.306376Z","title":"Training large language models to reason in a continuous latent space","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:01.306376Z"},"links":{"cited_paper":"/paper/2412.06769","citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:db9d0bade8362a3aaaf3d36e03c93441e9488f2b24e4cef594665a6cd61bdfa4","observation_id":"81097abb-f2f3-4b0a-9020-67de277c70b2","resolution":{"observed_at":"2026-08-07T14:39:01.306376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:10.895031Z","title":"Diffusionbert: Improving generative masked language models with diffusion models","venue":null,"work_id":"1188a1ab-5ee7-4375-b0f0-be298701ef9c","year":2023},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:01.439447Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:fe6e827131e3bf9505b35a864c77e9ab9c1210ec2ddfb5748a3f0a6ea1d26ace","observation_id":"c8c17fe8-e82b-466b-8c11-1b357b0453a6","resolution":{"observed_at":"2026-08-07T14:39:11.025766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:01.535721Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:01.535721Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:e233abf4695251548ed015f128d5fbb84bdff07189677e2e220d3136ec967393","observation_id":"d7038d43-b11b-4815-bcf0-f3694ec56bea","resolution":{"observed_at":"2026-08-07T14:39:01.535721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:01.669653Z","title":"Interpolated estimation of markov source parameters from sparse data","venue":null,"work_id":null,"year":1980},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:01.669653Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:2eb3d2278c4f450fba50ab328e8db6ecf2c25ad8715db85caffc08d0201efa1a","observation_id":"c2c09ced-eb9e-42cf-af79-e005c83c2df8","resolution":{"observed_at":"2026-08-07T14:39:01.669653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:01.838190Z","title":"An introduction to variational methods for graphical models","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:01.838190Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:d08ba0659b889a5dbc03f71acbfa0fd68c9c85fa6746390b917086dea012d4b6","observation_id":"2e5e736b-6781-45fd-9021-bda6475a412d","resolution":{"observed_at":"2026-08-07T14:39:01.838190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:01.958228Z","title":"Generalization through memorization: Nearest neighbor language models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:01.958228Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:574d986d6faac5a7c69ad77783c322c5b07f49773b3065ffb9f0d2d32163c7a4","observation_id":"34f21089-e3fc-4115-b4b6-f8eb4f407f9d","resolution":{"observed_at":"2026-08-07T14:39:01.958228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:10.526541Z","title":"Probabilistic graphical models: principles and techniques","venue":null,"work_id":"baed4641-afde-47aa-9f30-0ce65c6f89d4","year":2009},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:02.068479Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:b56a83484ae10281bd625d6d8ff8417ef3a601557de74b5da602320e9efd4ae2","observation_id":"eff69f4d-420c-427a-993d-7eaace310741","resolution":{"observed_at":"2026-08-07T14:39:10.657618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:02.207206Z","title":"Global optimality of the em algorithm for mixtures of two-component linear regressions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:02.207206Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:df84e5dc5e657bc90d51d42599e78332e0be8d08cc470b0ff0701328c51bfbb6","observation_id":"e18d0ff5-e2d8-463a-8ee1-c23d5b75cec7","resolution":{"observed_at":"2026-08-07T14:39:02.207206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:10.322920Z","title":"Visualizing and understanding neural models in nlp","venue":null,"work_id":"c4c6b4dd-f0ed-4553-b7d3-ed2641017199","year":2016},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:02.347477Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:3684c094b0250adef99bd7a1485ac012d621d3949a863667b196394229cfd768","observation_id":"6f351d66-6edc-4ed1-8017-160b1b2aa5c3","resolution":{"observed_at":"2026-08-07T14:39:10.434128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:10.070977Z","title":"Diffusion- LM improves controllable text generation","venue":null,"work_id":"8544ec78-3430-4215-98a8-ddd40a148f6e","year":2022},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:02.447565Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:d1e54ba9d0c68cb444bee81b0b0695f1946e04e172358dfaed948e475a439dca","observation_id":"b0bc1f4f-b1ad-4f5b-9e33-62babb78f3f7","resolution":{"observed_at":"2026-08-07T14:39:10.196642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:09.857992Z","title":"Diffusion- LM improves controllable text generation","venue":null,"work_id":"74b69c2e-f484-4627-98da-892aa41427aa","year":2022},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:02.569141Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:15c382861bb655cfea86955a2ff80236e7a4fe4e635c8348785a452c47532dce","observation_id":"8c10c74b-be92-47fa-abfe-0ac42a4c9758","resolution":{"observed_at":"2026-08-07T14:39:09.969440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:02.677502Z","title":"Assessing the ability of LSTM s to learn syntax-sensitive dependencies","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:02.677502Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:93305d0bfa65e16581822dbb4f9dc96b147e64e72e3c1c512528f5c926c280ce","observation_id":"f2482a7c-2923-4974-8a9b-db309645ec85","resolution":{"observed_at":"2026-08-07T14:39:02.677502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:09.666585Z","title":"Think while you generate: Discrete diffusion with planned denoising","venue":null,"work_id":"832bf358-0f00-44ef-9abe-e5c12bf2a0ea","year":2025},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:02.771744Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:2757a15a5e421c44b6027e47a31593443b34e7fe1b9dabe97df31f0ec8e3052b","observation_id":"6b6841c5-c06a-4b31-b4db-993a146c71a6","resolution":{"observed_at":"2026-08-07T14:39:09.746665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:02.946694Z","title":"Discrete diffusion modeling by estimating the ratios of the data distribution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:02.946694Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:01d0cb3a33b59add043fb1bfcb4f0ddfab2a28ab5a830860142d9ee8b7ded1fc","observation_id":"7f73c345-9412-4e2d-a716-d670484af5a6","resolution":{"observed_at":"2026-08-07T14:39:02.946694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:03.045391Z","title":"Building a large annotated corpus of english: The penn treebank","venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:03.045391Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:ea2e6928d0ddb9bed58238b6e0393db3464ce90f0e4043e45f1f47eeb5b7f71a","observation_id":"aa7e6ecf-d4cf-4448-a776-8d65fdc1da8d","resolution":{"observed_at":"2026-08-07T14:39:03.045391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:03.144178Z","title":"Pointer sentinel mixture models","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:03.144178Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:7cf134002f321c4158e7391e056a77ed8736ba42b198aeb18d2b501fc9bc3aa7","observation_id":"2736cb81-4fe8-4890-b218-59b68f90631b","resolution":{"observed_at":"2026-08-07T14:39:03.144178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:09.340489Z","title":"A view of the em algorithm that justifies incremental, sparse, and other variants","venue":null,"work_id":"c3001e92-b504-495f-bab2-6c60c284654f","year":1998},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:03.276776Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:e97a5e23dc0721cad351e75a6c96f6c4a8ed1f22f09be1373fd47060841d25c1","observation_id":"ee196ebe-5ce9-4170-905b-7b07569b7f71","resolution":{"observed_at":"2026-08-07T14:39:09.461268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:09.030520Z","title":"Scaling up masked diffusion models on text","venue":null,"work_id":"d53b73a3-a171-4869-864e-e8046a5ceb81","year":2025},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:03.445119Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:e7912e6bf3640ead979d47d25ba8f850ac316e356b5d386e7196bee4cac3d0c6","observation_id":"b62f61ea-352b-4877-9944-e8392f11765a","resolution":{"observed_at":"2026-08-07T14:39:09.169622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09992","last_updated":"2025-10-18T15:35:05Z","snapshot_observed_at":"2026-08-04T04:34:22.998376Z","submitted_at":"2025-02-14T08:23:51Z","title":"Large Language Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09992","snapshot_observed_at":"2026-08-07T14:39:03.552580Z","title":"Large language diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:03.552580Z"},"links":{"cited_paper":"/paper/2502.09992","citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:1cdecb3b3d3b93b642d3039ccb9238018826481329ec436c0a35ba0f5eff92dd","observation_id":"577880ad-df62-4238-a96f-b95136a3bd9c","resolution":{"observed_at":"2026-08-07T14:39:03.552580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:08.815125Z","title":"Your absorbing discrete diffusion secretly models the conditional distributions of clean data","venue":null,"work_id":"fe7bd757-b321-4566-b530-61870454ebdb","year":2025},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:03.689052Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:f6b9aad771847d2bed2cbe1edbbfe5cb99b1ea2882f7b4eb73ed9523975479a6","observation_id":"7680496e-5f4d-4d5d-aacb-0bf7e735aadd","resolution":{"observed_at":"2026-08-07T14:39:08.917469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:08.562161Z","title":"The lambada dataset: Word prediction requiring a broad discourse context","venue":null,"work_id":"b181fb55-3d76-40d8-848c-7cf664f1bcaa","year":2016},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:03.754863Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:dd0ff98f1731331e4abb3559d87ff295384f763348bf9f199307d411c0d8e437","observation_id":"9b78781d-9349-46ae-bce6-c001adcef62f","resolution":{"observed_at":"2026-08-07T14:39:08.679059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:03.891906Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:03.891906Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:55364e46e941934705077cfcd2650457e565362550e7fdca51cbb13accc5f62e","observation_id":"0383c29c-9de2-4043-987b-4abcc129ee00","resolution":{"observed_at":"2026-08-07T14:39:03.891906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:08.301506Z","title":"MAUVE : Measuring the gap between neural text and human text using divergence frontiers","venue":null,"work_id":"8401cc48-aba6-4456-bbf7-e55b7ff7d89f","year":2021},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:03.977371Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:5c8262096bdc21f35904b2125bd8048167e53f4f935060bd260721aae877af58","observation_id":"fd292724-2db5-482f-af43-3364a677df73","resolution":{"observed_at":"2026-08-07T14:39:08.411901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:04.119170Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:04.119170Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:fc543043943d6d38633a58f9a6dca2dd686e403a589c6435d8f17ee74a3a542a","observation_id":"11ff892a-711c-45b1-b894-c001827e7cfd","resolution":{"observed_at":"2026-08-07T14:39:04.119170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:04.258465Z","title":"Reasoning to learn from latent thoughts","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:04.258465Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:6c821e48020be49bcb8e48f227dc2cccc44e846d21319b3a90d7d4c5b64803c9","observation_id":"8978d614-a598-42a6-bac7-83ff302481c8","resolution":{"observed_at":"2026-08-07T14:39:04.258465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:04.363724Z","title":"Simple and effective masked diffusion language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:04.363724Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:b375446808fb93229532f7e10ecdc49c9e783d8a31f36e76fdd191e68a0a321c","observation_id":"8e61fd0c-1dd6-4922-ab9a-390a94f8e4d9","resolution":{"observed_at":"2026-08-07T14:39:04.363724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:04.501098Z","title":"Language models are greedy reasoners: A systematic formal analysis of chain-of-thought","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:04.501098Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:b88c13ebfd27a57a94b3ee078dab5d717b886459b8b921afee4a8008c6fa1c6a","observation_id":"c27fcd28-eb64-47d7-a8e6-c16b594a524a","resolution":{"observed_at":"2026-08-07T14:39:04.501098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21074","last_updated":"2025-09-23T08:16:08Z","snapshot_observed_at":"2026-08-07T17:46:47.440455Z","submitted_at":"2025-02-28T14:07:48Z","title":"CODI: Compressing Chain-of-Thought into Continuous Space via Self-Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.21074","snapshot_observed_at":"2026-08-07T14:39:04.630297Z","title":"Codi: Compressing chain-of-thought into continuous space via self-distillation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:04.630297Z"},"links":{"cited_paper":"/paper/2502.21074","citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:3f39d6e8e3fa325a49346c2602eb4f7b71c094d08426074047774869ba660078","observation_id":"9d85ea14-51fc-4f58-8f3c-55d150be0204","resolution":{"observed_at":"2026-08-07T14:39:04.630297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:08.026429Z","title":"Simplified and generalized masked diffusion for discrete data","venue":null,"work_id":"211e9b55-c56a-463a-8cc4-7c576988f9cd","year":2024},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:04.749940Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:059cd3afef822567f882b87b412743ae4e5e8d2ad85d7bc1f997705f4c5c38cd","observation_id":"52797b49-6834-454f-90ce-4cbc17988167","resolution":{"observed_at":"2026-08-07T14:39:08.119929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:04.904696Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:04.904696Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:30c702e001e5885b0f23c64ee76919b4d9e4494f4fddc4b43f4fe8f440669afb","observation_id":"789076cb-57e4-4164-9f2f-b028fc30978f","resolution":{"observed_at":"2026-08-07T14:39:04.904696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:05.033943Z","title":"Roformer: Enhanced transformer with rotary position embedding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:05.033943Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:9bf155498bf3084609edb2f7a82454923adc64949fd0389530d9e2c255695ffd","observation_id":"b083c11b-c25a-4976-ad72-58da2ff4e6da","resolution":{"observed_at":"2026-08-07T14:39:05.033943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:05.162980Z","title":"Axiomatic attribution for deep networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:05.162980Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:474f9f6754497393bd3f053befa5a75336eb29a7e34b9a57974b25dfe07dcdad","observation_id":"f46065ab-0d67-417a-b070-80c721e3d288","resolution":{"observed_at":"2026-08-07T14:39:05.162980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:07.729771Z","title":"Omninet: Omnidirectional representations from transformers","venue":null,"work_id":"ed8f423f-2200-4dc1-993d-30370d130a53","year":2021},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:05.284703Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:45e19947179e2510b961d6baab8678f4adcf6c5499184ab94d0d2c9ce49c0202","observation_id":"0e1b0904-a9cd-48b1-be79-e270eb47cf16","resolution":{"observed_at":"2026-08-07T14:39:07.855647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T14:39:05.403656Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:05.403656Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:6c18bfbd31267b6e47322381847d5899c933922c84671630d58cb8b1a65153b2","observation_id":"013a91ac-1994-4a00-ab92-2784262482ec","resolution":{"observed_at":"2026-08-07T14:39:05.403656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:05.506507Z","title":"BERT rediscovers the classical NLP pipeline","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:05.506507Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:39c6088403a2523bea7b725047e4478f9819b650c9c243f1b9982b60ee86d4d6","observation_id":"f75ed19a-4e6c-489f-b379-66ccc26975cf","resolution":{"observed_at":"2026-08-07T14:39:05.506507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T14:39:05.666687Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:05.666687Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:a54c360408a03094529796f712efa243197b6cf42b30ffa142e661baae8826a3","observation_id":"d0bc9ceb-8d24-4520-b232-b4ad8704242a","resolution":{"observed_at":"2026-08-07T14:39:05.666687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:07.501789Z","title":"Glauber generative model: Discrete diffusion models via binary classification","venue":null,"work_id":"c7a02f08-eadc-40cb-a979-6ab2814445ad","year":2025},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:05.799813Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:6feb7bdef5d3e7e2610800645c1bdbfde6c80efde0d733a8bf65efd55d07b368","observation_id":"85cc6d48-6334-4d71-b06e-37ebd5d0a678","resolution":{"observed_at":"2026-08-07T14:39:07.574901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04482","last_updated":"2025-06-09T14:23:45Z","snapshot_observed_at":"2026-08-07T17:24:35.915580Z","submitted_at":"2025-03-06T14:30:55Z","title":"Generalized Interpolating Discrete Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04482","snapshot_observed_at":"2026-08-07T14:39:05.956211Z","title":"u tte, Janis Fluri, Yuhui Ding, Antonio Orvieto, Bernhard Sch \\","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:05.956211Z"},"links":{"cited_paper":"/paper/2503.04482","citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:f7d4e4b67142d3a55d9f09138bccb66534f66aa6c8e010d725529bcd584ec891","observation_id":"8dac312e-0a18-448f-9aef-879f82478e9d","resolution":{"observed_at":"2026-08-07T14:39:05.956211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.04094","last_updated":"2019-04-09T18:01:28Z","snapshot_observed_at":"2026-08-06T22:51:14.869467Z","submitted_at":"2019-02-11T19:02:27Z","title":"BERT has a Mouth, and It Must Speak: BERT as a Markov Random Field Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.04094","snapshot_observed_at":"2026-08-07T14:39:06.099849Z","title":"Bert has a mouth, and it must speak: Bert as a markov random field language model","venue":null,"work_id":null,"year":1902},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:06.099849Z"},"links":{"cited_paper":"/paper/1902.04094","citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:ec81cf3c7c7e94bf85711eca0cc492a455a40cc794e0c70f5b59c2a45d6d6aed","observation_id":"5a49883a-7e80-453e-94d2-9a19b3764475","resolution":{"observed_at":"2026-08-07T14:39:06.099849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:06.329306Z","title":"Remasking discrete diffusion models with inference-time scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:06.329306Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:7ba2dd40a844fab4511265a6c0f4d3518af39e7e18155d18d212fa1e60b11beb","observation_id":"63b72750-fdb6-4100-8109-9922448c60fb","resolution":{"observed_at":"2026-08-07T14:39:06.329306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:06.462125Z","title":"Chi, Quoc V Le, and Denny Zhou","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:06.462125Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:2e340f8f7139a3f908faa5baf726a787b2ef3a232ba12d6f36039387fdaa8fc5","observation_id":"11f7d00d-5aa2-45ec-b584-68d78733c570","resolution":{"observed_at":"2026-08-07T14:39:06.462125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:06.559572Z","title":"Character-level convolutional networks for text classification","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:06.559572Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:29ea5c82972ee52bd9691fcc67d22cc1532b653e13ed35d23caa378ae7c51a82","observation_id":"24b1131a-576b-42be-8812-9106dfe1551b","resolution":{"observed_at":"2026-08-07T14:39:06.559572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:39:06.681448Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T14:39:06.681448Z"},"links":{"citing_paper":"/paper/2505.18456"},"observation_digest":"sha256:defed9d856f76c8d21358efa661c1355015a1993ded3d8a3f4909c0d6c2cb0a0","observation_id":"eb49ba51-7621-4309-9ee0-36f2b9f81b18","resolution":{"observed_at":"2026-08-07T14:39:06.681448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.18456","last_updated":"2025-05-24T01:34:14Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T20:06:37.410391Z","submitted_at":"2025-05-24T01:34:14Z","title":"Anchored Diffusion Language Model"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":0,"verified_fuzzy":24},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 7 inbound Pith citation observations for arXiv:2505.18456."}