{"as_of":"2026-08-10T23:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4b1dcb26cbe5201b9130c24f701325a8e3118e0f10589b3a7f45bfb368974116","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T14:01:55.709959Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:14:22.746297Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15781","snapshot_observed_at":"2026-08-06T19:14:22.746297Z","title":"Large language models to diffusion finetuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06203","last_updated":"2025-07-10T16:43:36Z","snapshot_observed_at":"2026-08-07T04:57:37.201438Z","submitted_at":"2025-07-08T17:29:07Z","title":"A Survey on Latent Reasoning","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T19:14:22.746297Z"},"links":{"cited_paper":"/paper/2501.15781","citing_paper":"/paper/2507.06203"},"observation_digest":"sha256:748e5fa2558a64f138daee86b5d1ca0626bb82a1aaeff321d4e97e11d8fdb413","observation_id":"bbeba7c7-5306-4a65-8801-caf87b94801f","resolution":{"observed_at":"2026-08-06T19:14:22.746297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15781","snapshot_observed_at":"2026-08-04T08:09:17.276937Z","title":"Large language models to diffusion finetuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.22510","last_updated":"2026-07-11T23:42:33Z","snapshot_observed_at":"2026-08-06T14:12:10.171134Z","submitted_at":"2025-10-26T03:24:31Z","title":"CANDI: Hybrid Discrete-Continuous Diffusion Models","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T08:09:17.276937Z"},"links":{"cited_paper":"/paper/2501.15781","citing_paper":"/paper/2510.22510"},"observation_digest":"sha256:9590672f21c613e85d6c6d78a2e2d4b9494054a6ddf691b8c7d1479eec9a2c64","observation_id":"bf5dedda-eeaa-4f78-966f-55dc69cc0cd0","resolution":{"observed_at":"2026-08-04T08:09:17.276937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2501.15781/citation-record","integrity":"/paper/2501.15781/integrity","json":"/paper/2501.15781/citation-record.json","paper":"/paper/2501.15781"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-10T14:01:55.432076Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:55.432076Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2501.15781"},"observation_digest":"sha256:a5fdf5e9efabd7689315827ee07afd9b253bd8565d2dc0f80e049267bc1b4400","observation_id":"3ae30cca-1279-4575-ab47-97f2239842a0","resolution":{"observed_at":"2026-08-10T14:01:55.432076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:01:56.674082Z","title":null,"venue":null,"work_id":"a2dd9f5f-870d-4a11-9155-3eca7c5c27e5","year":null},"citing_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:55.649459Z"},"links":{"citing_paper":"/paper/2501.15781"},"observation_digest":"sha256:3199a8f3a7ed3326d20c5d908ba8afb52de02e0b113ffe8486a09c5edef42bef","observation_id":"f27de049-ad2a-4870-863b-a08fe977031d","resolution":{"observed_at":"2026-08-10T14:01:56.679109Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:01:56.659281Z","title":null,"venue":null,"work_id":"5541fa4b-500c-4958-9b77-bee1b4c4df69","year":2022},"citing_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:55.654301Z"},"links":{"citing_paper":"/paper/2501.15781"},"observation_digest":"sha256:ab1d6d447589450749d8986a81ad8d2b076271d8b592048105240adbcfeb05e2","observation_id":"5026494a-adf1-4f74-9094-357d32d5da01","resolution":{"observed_at":"2026-08-10T14:01:56.664082Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04997","last_updated":"2024-06-05T20:31:17Z","snapshot_observed_at":"2026-08-09T23:34:45.674930Z","submitted_at":"2024-02-07T16:15:36Z","title":"Generative Flows on Discrete State-Spaces: Enabling Multimodal Flows with Applications to Protein Co-Design","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04997","snapshot_observed_at":"2026-08-10T14:01:55.453730Z","title":"Generative flows on discrete state-spaces: Enabling multimodal flows with applications to protein co-design","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:55.453730Z"},"links":{"cited_paper":"/paper/2402.04997","citing_paper":"/paper/2501.15781"},"observation_digest":"sha256:6bb7eaf9c7ba866860bca508e0fa234745e15eb0969d8ccd32caedd6da2854cf","observation_id":"dd037e82-296e-4cb3-83a3-18e1c2115de3","resolution":{"observed_at":"2026-08-10T14:01:55.453730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-10T14:01:55.458796Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:55.458796Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2501.15781"},"observation_digest":"sha256:bab1be56d8b955a05c4ea405014b280feafc0252b6a090b530183e8058db9db8","observation_id":"9c217ac2-4234-4235-a885-71c54118fee0","resolution":{"observed_at":"2026-08-10T14:01:55.458796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-10T14:01:55.474009Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:55.474009Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2501.15781"},"observation_digest":"sha256:eb1b11af89e11d76a660c5076312cc4d13e2675a040f50200007c47963c2bd16","observation_id":"3c37b60f-e067-48b5-a9ba-b46dcd5961d1","resolution":{"observed_at":"2026-08-10T14:01:55.474009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.15089","last_updated":"2022-12-15T14:27:19Z","snapshot_observed_at":"2026-08-07T07:03:02.158312Z","submitted_at":"2022-11-28T06:08:54Z","title":"Continuous diffusion for categorical data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.15089","snapshot_observed_at":"2026-08-10T14:01:55.483857Z","title":"H., Doucet, A., Strudel, R., Dyer, C., Durkan, C., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:55.483857Z"},"links":{"cited_paper":"/paper/2211.15089","citing_paper":"/paper/2501.15781"},"observation_digest":"sha256:40fdc49bcc791a62f89651a115a6887a7a021b356484fec2d4b3f393625fbd27","observation_id":"c3c69e1f-4748-4594-88ad-93abe0682eda","resolution":{"observed_at":"2026-08-10T14:01:55.483857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-10T14:01:55.488657Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:55.488657Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2501.15781"},"observation_digest":"sha256:b07a5dbdc66cbfb93ebf0cd32e97739a40611052cd3d747d40d172042778ed2f","observation_id":"dab0d90f-08e3-4b9a-a2bd-c5757bdcebc3","resolution":{"observed_at":"2026-08-10T14:01:55.488657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15595","last_updated":"2024-11-05T10:02:42Z","snapshot_observed_at":"2026-08-10T20:56:14.949757Z","submitted_at":"2024-07-22T12:33:27Z","title":"Discrete Flow Matching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15595","snapshot_observed_at":"2026-08-10T14:01:55.498434Z","title":"Gat, I., Remez, T., Shaul, N., Kreuk, F., Chen, R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:55.498434Z"},"links":{"cited_paper":"/paper/2407.15595","citing_paper":"/paper/2501.15781"},"observation_digest":"sha256:099e8fe50661aae19c29ec16746b85890453d4114f1fecbb1a83a4e0923d077c","observation_id":"d8ee3f48-10f2-4ad2-98c5-5f22cb241549","resolution":{"observed_at":"2026-08-10T14:01:55.498434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-10T14:01:55.503207Z","title":"Deepseek-r1: In- centivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:55.503207Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2501.15781"},"observation_digest":"sha256:f8012205579daffd91cd7219fb2f9ec2b250313c69ff4785a48f42ce7ef407bb","observation_id":"8ab1f1c8-3648-4c56-9e30-1116a827e5e4","resolution":{"observed_at":"2026-08-10T14:01:55.503207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14771","last_updated":"2024-02-14T17:45:41Z","snapshot_observed_at":"2026-08-10T20:57:49.457850Z","submitted_at":"2023-05-24T06:22:14Z","title":"David helps Goliath: Inference-Time Collaboration Between Small Specialized and Large General Diffusion LMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14771","snapshot_observed_at":"2026-08-10T14:01:55.512734Z","title":"David helps goliath: Inference-time collaboration be- tween small specialized and large general diffusion lms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:55.512734Z"},"links":{"cited_paper":"/paper/2305.14771","citing_paper":"/paper/2501.15781"},"observation_digest":"sha256:d5e1d6cc1da14e16b7577ca1a17594a93c48b8c6a9ae3839b73eda192ecc76d1","observation_id":"a3dbc52d-740b-4e75-8fab-4f9971fa32dd","resolution":{"observed_at":"2026-08-10T14:01:55.512734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.15029","last_updated":"2022-11-30T15:41:24Z","snapshot_observed_at":"2026-08-04T09:42:38.461420Z","submitted_at":"2022-11-28T03:25:49Z","title":"DiffusionBERT: Improving Generative Masked Language Models with Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.15029","snapshot_observed_at":"2026-08-10T14:01:55.517625Z","title":"Diffu- sionbert: Improving generative masked language models with diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:55.517625Z"},"links":{"cited_paper":"/paper/2211.15029","citing_paper":"/paper/2501.15781"},"observation_digest":"sha256:60b4a2eb2b182bc211a9e19e2fd0a63dd36653d0bee5a421a88c0f81f0cb8580","observation_id":"6e02e4c7-40d8-482e-a9d9-7aac5340d66b","resolution":{"observed_at":"2026-08-10T14:01:55.517625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-10T14:01:55.527075Z","title":"J., Shen, Y ., Wallis, P., Allen-Zhu, Z., Li, Y ., Wang, S., Wang, L., and Chen, W","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:55.527075Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2501.15781"},"observation_digest":"sha256:663fd7a7cc40b4d6c7c57ec3d76abc3d9958857d95b34ef4323a6e4342519f79","observation_id":"342bc206-7e1e-4edc-8f4b-78d91834823b","resolution":{"observed_at":"2026-08-10T14:01:55.527075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-08-10T14:01:55.531811Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:55.531811Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2501.15781"},"observation_digest":"sha256:faa99cbb56b8d66cea7ab45aa9bbe22c4bb8600fbea6e5caefdfe425926ff992","observation_id":"016414e4-8d54-4202-acd5-c65a64ae4b6a","resolution":{"observed_at":"2026-08-10T14:01:55.531811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-10T14:01:55.536536Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:55.536536Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2501.15781"},"observation_digest":"sha256:f1eb944ab658e3f09fcc4e3ebd70ea29856b5d5f5dbf7965e426970dc6182a55","observation_id":"a1060a05-cb7b-4511-9cd7-aabac4252f8d","resolution":{"observed_at":"2026-08-10T14:01:55.536536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12917","last_updated":"2024-10-04T17:28:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-19T17:16:21Z","title":"Training Language Models to Self-Correct via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12917","snapshot_observed_at":"2026-08-10T14:01:55.541295Z","title":"D., Singh, A., Baumli, K., Iqbal, S., Bishop, C., Roelofs, R., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:55.541295Z"},"links":{"cited_paper":"/paper/2409.12917","citing_paper":"/paper/2501.15781"},"observation_digest":"sha256:8db49bcdc92ee29a2926c641faee23887ff7285ef968ce383682750ffe4a3c76","observation_id":"60379636-f7a1-402b-9de0-8f88f2a447df","resolution":{"observed_at":"2026-08-10T14:01:55.541295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20320","last_updated":"2024-10-08T21:40:13Z","snapshot_observed_at":"2026-08-10T20:57:28.000116Z","submitted_at":"2024-05-30T17:56:04Z","title":"Improving the Training of Rectified Flows","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20320","snapshot_observed_at":"2026-08-10T14:01:55.546098Z","title":"Improving the training of rectified flows","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:55.546098Z"},"links":{"cited_paper":"/paper/2405.20320","citing_paper":"/paper/2501.15781"},"observation_digest":"sha256:aa1495d44ef201967348bf8d4235be7e78fcb4afb236263ce111b60140995d73","observation_id":"56665eb6-ac22-4d71-85d7-d5682a2302a8","resolution":{"observed_at":"2026-08-10T14:01:55.546098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06264","last_updated":"2024-12-09T07:22:38Z","snapshot_observed_at":"2026-08-02T09:54:14.339169Z","submitted_at":"2024-12-09T07:22:38Z","title":"Flow Matching Guide and Code","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06264","snapshot_observed_at":"2026-08-10T14:01:55.550862Z","title":"T., Lopez-Paz, D., Ben-Hamu, H., and Gat, I","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:55.550862Z"},"links":{"cited_paper":"/paper/2412.06264","citing_paper":"/paper/2501.15781"},"observation_digest":"sha256:85318ee9fde20872fe5c415a4a15f706cd635e84782431df0766bfcea3fc4bf8","observation_id":"2f989b62-d9b4-4e4f-90fd-e26e520a226e","resolution":{"observed_at":"2026-08-10T14:01:55.550862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15028","last_updated":"2024-04-02T17:51:49Z","snapshot_observed_at":"2026-08-10T20:57:16.653203Z","submitted_at":"2023-09-26T15:57:57Z","title":"Don't throw away your value model! Generating more preferable text with Value-Guided Monte-Carlo Tree Search decoding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15028","snapshot_observed_at":"2026-08-10T14:01:55.556008Z","title":"Don’t throw away your value model! generating more preferable text with value- guided monte-carlo tree search decoding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:55.556008Z"},"links":{"cited_paper":"/paper/2309.15028","citing_paper":"/paper/2501.15781"},"observation_digest":"sha256:9fa037152d9679a0fffabdb23fed570f5ee9dc986c765fd702c31041f6f1724a","observation_id":"50fffcb3-62f5-41ba-9ddf-57f26ff60e28","resolution":{"observed_at":"2026-08-10T14:01:55.556008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-10T14:01:55.561129Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:55.561129Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2501.15781"},"observation_digest":"sha256:5b16008dc3e7a700dbb009c633f059871ae3e261f049d87c33a1634f3262ae10","observation_id":"1cb58ec6-efda-4adf-ad1e-8211c66834aa","resolution":{"observed_at":"2026-08-10T14:01:55.561129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-10T14:01:55.565865Z","title":"Decoupled weight decay regularization.arXiv preprint arXiv:1711.05101,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:55.565865Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2501.15781"},"observation_digest":"sha256:b6efe9783e5d2a0968de6db355244ec37921f32e7cf00b704f0ad874f1008a11","observation_id":"42bb7453-08e1-46be-b41e-ec0a4c7f5b37","resolution":{"observed_at":"2026-08-10T14:01:55.565865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16834","last_updated":"2024-06-06T21:06:44Z","snapshot_observed_at":"2026-07-06T16:38:29.188225Z","submitted_at":"2023-10-25T17:59:12Z","title":"Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16834","snapshot_observed_at":"2026-08-10T14:01:55.570623Z","title":"Discrete diffusion model- ing by estimating the ratios of the data distribution","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:55.570623Z"},"links":{"cited_paper":"/paper/2310.16834","citing_paper":"/paper/2501.15781"},"observation_digest":"sha256:66679d0f2fdb14a9c004b77da6ad7f60aba50a280a0974f35b3e56a93dac95ab","observation_id":"33101ca9-117a-44cf-90b9-ac4479580161","resolution":{"observed_at":"2026-08-10T14:01:55.570623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04220","last_updated":"2024-08-08T05:06:22Z","snapshot_observed_at":"2026-08-10T13:35:49.549767Z","submitted_at":"2024-08-08T05:06:22Z","title":"Diffusion Guided Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04220","snapshot_observed_at":"2026-08-10T14:01:55.575387Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:55.575387Z"},"links":{"cited_paper":"/paper/2408.04220","citing_paper":"/paper/2501.15781"},"observation_digest":"sha256:3045906a571bfec7e06ea2f5be82ab7b585aaa1c6da3911cf09d2a2277626426","observation_id":"9e1aa101-ef4c-437e-9ea3-73f37b20fe55","resolution":{"observed_at":"2026-08-10T14:01:55.575387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.08379","last_updated":"2024-02-21T00:06:20Z","snapshot_observed_at":"2026-07-06T15:27:06.126421Z","submitted_at":"2023-05-15T06:33:45Z","title":"TESS: Text-to-Text Self-Conditioned Simplex Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.08379","snapshot_observed_at":"2026-08-10T14:01:55.579965Z","title":"K., Ivison, H., Tae, J., Henderson, J., Belt- agy, I., Peters, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:55.579965Z"},"links":{"cited_paper":"/paper/2305.08379","citing_paper":"/paper/2501.15781"},"observation_digest":"sha256:77e1b31a2197f9cabab1fb49fe21e6c86b468999481783359b187b6e3bef6b84","observation_id":"0b833560-ce13-4e18-8a9e-32132f364357","resolution":{"observed_at":"2026-08-10T14:01:55.579965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-10T14:01:55.584954Z","title":"L., Fei-Fei, L., Hajishirzi, H., Zettlemoyer, L., Liang, P., Cand `es, E., and Hashimoto, T","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:55.584954Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2501.15781"},"observation_digest":"sha256:b333c0bbe4562d5c6c21559d002d02c196cd81402259f1eb9fcceac4c105c166","observation_id":"8e1f648b-22f9-4eec-b5c9-5b51bf0842b7","resolution":{"observed_at":"2026-08-10T14:01:55.584954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08929","last_updated":"2024-06-23T23:18:07Z","snapshot_observed_at":"2026-08-10T22:51:46.739828Z","submitted_at":"2024-06-13T08:58:45Z","title":"Step-by-Step Diffusion: An Elementary Tutorial","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08929","snapshot_observed_at":"2026-08-10T14:01:55.590136Z","title":"Step- by-step diffusion: An elementary tutorial","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:55.590136Z"},"links":{"cited_paper":"/paper/2406.08929","citing_paper":"/paper/2501.15781"},"observation_digest":"sha256:77a514d22b559c8abfb4fdd27abd7b215216291ddf0d646b3390ceff15293f64","observation_id":"81fadb35-51e4-4c02-befd-b79f9671a0ed","resolution":{"observed_at":"2026-08-10T14:01:55.590136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07524","last_updated":"2024-11-10T20:34:34Z","snapshot_observed_at":"2026-08-10T20:57:25.396291Z","submitted_at":"2024-06-11T17:51:40Z","title":"Simple and Effective Masked Diffusion Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07524","snapshot_observed_at":"2026-08-10T14:01:55.600252Z","title":"S., Arriola, M., Schiff, Y ., Gokaslan, A., Marro- quin, E., Chiu, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:55.600252Z"},"links":{"cited_paper":"/paper/2406.07524","citing_paper":"/paper/2501.15781"},"observation_digest":"sha256:83e63c122c08c523d376cc397b0c8be9f7f42b0e41619951fdb80cc863cbb008","observation_id":"b6cdf51c-c155-409f-a7f0-b3f7eae768d0","resolution":{"observed_at":"2026-08-10T14:01:55.600252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-10T14:01:55.609984Z","title":"Scaling llm test- time compute optimally can be more effective than scal- ing model parameters","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:55.609984Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2501.15781"},"observation_digest":"sha256:a3b1c5beb3fafcce1e6dbd35ad94d0bc2f1e8ca1eb45a44669d03c9fa7fd810f","observation_id":"08f5bfed-1969-4fac-b8ba-592edb3c39dd","resolution":{"observed_at":"2026-08-10T14:01:55.609984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-10T14:01:55.619919Z","title":"P., Kumar, A., Er- mon, S., and Poole, B","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:55.619919Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2501.15781"},"observation_digest":"sha256:96fc35d03b7141098359132bb8874fcde215a0d050b882143ce96a0e0415be0e","observation_id":"41eb8b2a-1063-41a3-b8bc-3d76424eb2be","resolution":{"observed_at":"2026-08-10T14:01:55.619919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-10T14:01:55.625099Z","title":"M., Hauth, A., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:55.625099Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2501.15781"},"observation_digest":"sha256:8af171baa295ac32a4c2b3c88bc262fc3a6b440ef9474332255d9d1fe94462c9","observation_id":"d49d819b-5459-4527-8451-0a0ac223990b","resolution":{"observed_at":"2026-08-10T14:01:55.625099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09685","last_updated":"2025-01-20T22:00:26Z","snapshot_observed_at":"2026-08-10T19:43:20.086799Z","submitted_at":"2025-01-16T17:37:35Z","title":"Inference-Time Alignment in Diffusion Models with Reward-Guided Generation: Tutorial and Review","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09685","snapshot_observed_at":"2026-08-10T14:01:55.629922Z","title":"Inference-time alignment in diffu- sion models with reward-guided generation: Tutorial and review","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:55.629922Z"},"links":{"cited_paper":"/paper/2501.09685","citing_paper":"/paper/2501.15781"},"observation_digest":"sha256:93024d142f88ae55f4a8a5e774f7a48c0237d8a498bc528ce2c6c46e2c0b3ac1","observation_id":"35e958e2-2590-4fcd-a913-8d44244623e1","resolution":{"observed_at":"2026-08-10T14:01:55.629922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10001","last_updated":"2023-06-01T05:38:00Z","snapshot_observed_at":"2026-08-07T18:44:16.941060Z","submitted_at":"2022-12-20T05:20:54Z","title":"Towards Understanding Chain-of-Thought Prompting: An Empirical Study of What Matters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10001","snapshot_observed_at":"2026-08-10T14:01:55.635017Z","title":"Towards understanding chain-of-thought prompting: An empirical study of what matters","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:55.635017Z"},"links":{"cited_paper":"/paper/2212.10001","citing_paper":"/paper/2501.15781"},"observation_digest":"sha256:56e149f68925fb1b78b4954d899ff6cd481f15815b2f81a424f86d058d8892ed","observation_id":"762e25e8-34e0-428d-aba7-a6cc621749e5","resolution":{"observed_at":"2026-08-10T14:01:55.635017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10325","last_updated":"2023-05-22T17:31:46Z","snapshot_observed_at":"2026-07-06T14:32:59.739845Z","submitted_at":"2022-12-20T15:16:24Z","title":"SeqDiffuSeq: Text Diffusion with Encoder-Decoder Transformers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10325","snapshot_observed_at":"2026-08-10T14:01:55.639705Z","title":"Seqdif- fuseq: Text diffusion with encoder-decoder transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:55.639705Z"},"links":{"cited_paper":"/paper/2212.10325","citing_paper":"/paper/2501.15781"},"observation_digest":"sha256:74bf7a40f35da6efa77727ebb102bff93111c3e5076be6372ccc24ea1f3bfc40","observation_id":"7b3a8346-868c-44e1-822d-c99246e85a4f","resolution":{"observed_at":"2026-08-10T14:01:55.639705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.05737","last_updated":"2024-08-02T16:09:14Z","snapshot_observed_at":"2026-08-06T16:42:40.001017Z","submitted_at":"2023-02-11T16:26:57Z","title":"A Reparameterized Discrete Diffusion Model for Text Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.05737","snapshot_observed_at":"2026-08-10T14:01:55.644580Z","title":"A reparameter- ized discrete diffusion model for text generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:55.644580Z"},"links":{"cited_paper":"/paper/2302.05737","citing_paper":"/paper/2501.15781"},"observation_digest":"sha256:312f148537e04ae553c603e8b6a5c7aad1ee6a858705ad391d8e34ae7654dd03","observation_id":"9b364647-a912-48bd-a97d-40e6d7f7dbce","resolution":{"observed_at":"2026-08-10T14:01:55.644580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:01:56.643648Z","title":"coding\",","venue":null,"work_id":"223db23c-60b7-4441-acab-9b06165dd693","year":2024},"citing_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:55.659341Z"},"links":{"citing_paper":"/paper/2501.15781"},"observation_digest":"sha256:f15b7ccf0b6eb588d63f04528af0f66159d1f8ad536c56155ed17663adb51158","observation_id":"e3c0acaa-b43e-44b5-a490-0d2f7eb22c71","resolution":{"observed_at":"2026-08-10T14:01:56.648470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:01:56.627763Z","title":"Similarly, pass@1, pass@5, and pass@10 are calculated by verifying model generations on unit tests","venue":null,"work_id":"cef390ea-1fdc-4804-a655-e4df20c63720","year":2022},"citing_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:55.664531Z"},"links":{"citing_paper":"/paper/2501.15781"},"observation_digest":"sha256:6e62c7964825d02d66097f4550111e627fe9633ff3b1f64d0e408966505c09e9","observation_id":"7ed01979-f369-4488-bcdb-51ba55c8f024","resolution":{"observed_at":"2026-08-10T14:01:56.633492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:01:56.595098Z","title":null,"venue":null,"work_id":"e3f5de8d-4185-4df0-8ad7-070b8adc5029","year":2022},"citing_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:55.675100Z"},"links":{"citing_paper":"/paper/2501.15781"},"observation_digest":"sha256:4c721c5a284d6b5232496ad091a9aa54c5f06c8aedb1a674d95875460bbec587","observation_id":"8a370f65-b4b9-4892-a443-5d9978694565","resolution":{"observed_at":"2026-08-10T14:01:56.600158Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:01:56.560834Z","title":null,"venue":null,"work_id":"d55ebd41-2114-475b-8643-5862d7cfcb27","year":2020},"citing_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:55.684687Z"},"links":{"citing_paper":"/paper/2501.15781"},"observation_digest":"sha256:c1a6243dcedd64bf4d7d3bed074f1f34693846a814fc147902944735c76e8310","observation_id":"7bceb311-90df-46d7-b927-6f3bd4719799","resolution":{"observed_at":"2026-08-10T14:01:56.566699Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:01:56.541762Z","title":"best-of-N","venue":null,"work_id":"87828124-b9d9-4adb-a8aa-1a2959f921a6","year":2022},"citing_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:55.689403Z"},"links":{"citing_paper":"/paper/2501.15781"},"observation_digest":"sha256:33b590434c2800c6403b97da5210826ff3d00ba3b12e666f965c81276993c6f8","observation_id":"9a0d8853-1940-4dfa-8a91-dc20da39245d","resolution":{"observed_at":"2026-08-10T14:01:56.548217Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:01:56.524655Z","title":null,"venue":null,"work_id":"68b8fe0b-f629-4b2e-b979-128da38629aa","year":2024},"citing_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:55.694761Z"},"links":{"citing_paper":"/paper/2501.15781"},"observation_digest":"sha256:fc35dd263896536dbd9bdb9943689bef6fe17fcbeedd40c0d5cfd632e3c47b70","observation_id":"c00cf7b3-b4b3-49af-a8b5-a53b332a7175","resolution":{"observed_at":"2026-08-10T14:01:56.529830Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:01:56.508021Z","title":"<think>/<answer>","venue":null,"work_id":"ccf3ee73-be07-4289-b712-74d9a4ec369d","year":2022},"citing_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:55.699900Z"},"links":{"citing_paper":"/paper/2501.15781"},"observation_digest":"sha256:bd6789421af063b899265b8e02ad324e54a7ca310bcd3b2de1b3fa47e969a503","observation_id":"e8a8c927-dfaf-4608-8ab6-cac4ad68403f","resolution":{"observed_at":"2026-08-10T14:01:56.513234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:01:56.490478Z","title":null,"venue":null,"work_id":"2544967c-8c62-4e32-80ea-ae9d1ca37401","year":2022},"citing_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:55.705100Z"},"links":{"citing_paper":"/paper/2501.15781"},"observation_digest":"sha256:fcc75cd113b9030945b2ed617d41f432d1db76e36fa08d274e9a840a08bccd56","observation_id":"af5c3cc1-ecf5-494b-b715-1d38f65a1e92","resolution":{"observed_at":"2026-08-10T14:01:56.495730Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:01:56.471200Z","title":null,"venue":null,"work_id":"76b2db72-080a-4304-b1ff-f1766bce626e","year":2024},"citing_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:55.709959Z"},"links":{"citing_paper":"/paper/2501.15781"},"observation_digest":"sha256:27b1f652f168bd6d9de18c04df4944f781d1ddfd938dbe9f2433d33d55ce6ea6","observation_id":"4fc5f11e-afdd-4583-8375-3469a6095a1e","resolution":{"observed_at":"2026-08-10T14:01:56.478189Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:01:56.611151Z","title":null,"venue":null,"work_id":"84e5dcf9-aa6a-4163-b10b-2365eac92a7a","year":2022},"citing_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:55.669279Z"},"links":{"citing_paper":"/paper/2501.15781"},"observation_digest":"sha256:da96c5f19259ca59c6eabf4054706ba5e740d4e7a08f473f676bcf4fd116b2df","observation_id":"b445b717-58c8-470d-881b-b4421dbadfc0","resolution":{"observed_at":"2026-08-10T14:01:56.616880Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:01:56.578684Z","title":"Extended Results D.1","venue":null,"work_id":"b4a5f55a-6cc7-4943-ac1d-277b58261907","year":2021},"citing_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"reference_index":128,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:55.679859Z"},"links":{"citing_paper":"/paper/2501.15781"},"observation_digest":"sha256:1d34f53026e386d4d99de080d0f0c11033d50ae10aeb21d2f2f29a5e6854d130","observation_id":"a1de2721-2147-4266-81f8-70d785fb22e0","resolution":{"observed_at":"2026-08-10T14:01:56.583983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-07-06T16:25:25.534843Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-10T14:01:55.493801Z","title":"M., Wen, Y ., Zhang, W., and Wang, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"reference_index":1969,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:55.493801Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2501.15781"},"observation_digest":"sha256:7a31e84822761cfdeab3ff9998d4155586104b782e5a228177e0ed3910b9199d","observation_id":"18bb0357-4e3d-4883-8230-f7d2ff9d439a","resolution":{"observed_at":"2026-08-10T14:01:55.493801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-10T14:01:55.614869Z","title":"Denoising diffusion im- plicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:55.614869Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2501.15781"},"observation_digest":"sha256:7a003fae8958267feeee4c27ec25727a59a5ba1f8838fdff96ab2215acea2daf","observation_id":"50a062a5-5248-4a6c-9bec-5fb5fab267cb","resolution":{"observed_at":"2026-08-10T14:01:55.614869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.06749","last_updated":"2022-04-19T17:50:01Z","snapshot_observed_at":"2026-08-10T20:57:11.694496Z","submitted_at":"2021-12-13T16:00:33Z","title":"Step-unrolled Denoising Autoencoders for Text Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.06749","snapshot_observed_at":"2026-08-10T14:01:55.605080Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:55.605080Z"},"links":{"cited_paper":"/paper/2112.06749","citing_paper":"/paper/2501.15781"},"observation_digest":"sha256:d40c9751d1580b67f3b080ecd04138de17fa5cd0192b954b110b3d9fdceed643","observation_id":"c71652bd-c751-4c1c-8c2b-6c309e228e08","resolution":{"observed_at":"2026-08-10T14:01:55.605080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-10T14:01:55.522321Z","title":"and Salimans, T","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:55.522321Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2501.15781"},"observation_digest":"sha256:9c30a2ab697cfe5f8b8cf1d68be3846a8aeed1fc181101365494ecd23e7c4b79","observation_id":"169b1e6c-4a8b-4000-9bc5-2f9f499f0936","resolution":{"observed_at":"2026-08-10T14:01:55.522321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.04202","last_updated":"2023-03-01T00:18:33Z","snapshot_observed_at":"2026-08-06T15:11:19.955049Z","submitted_at":"2022-08-08T15:08:40Z","title":"Analog Bits: Generating Discrete Data using Diffusion Models with Self-Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.04202","snapshot_observed_at":"2026-08-10T14:01:55.464466Z","title":"Chen, T., Zhang, R., and Hinton, G","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:55.464466Z"},"links":{"cited_paper":"/paper/2208.04202","citing_paper":"/paper/2501.15781"},"observation_digest":"sha256:81629f5fe4eccbf09760f8f59a58d4ecbe65df626f92d60bc3f8e0b21b441627","observation_id":"0706661f-e94e-4081-b000-0bc171da4569","resolution":{"observed_at":"2026-08-10T14:01:55.464466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.16886","last_updated":"2022-10-30T16:55:23Z","snapshot_observed_at":"2026-08-09T22:27:50.128840Z","submitted_at":"2022-10-30T16:55:23Z","title":"DiffusER: Discrete Diffusion via Edit-based Reconstruction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.16886","snapshot_observed_at":"2026-08-10T14:01:55.595446Z","title":"J., and Neubig, G","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:55.595446Z"},"links":{"cited_paper":"/paper/2210.16886","citing_paper":"/paper/2501.15781"},"observation_digest":"sha256:ed4deccf3f27592bea49301971e4b23371e5f442f767fb4d44875413c1ecf0de","observation_id":"7dd8bd9c-9f97-4194-9c5d-77fbad816e76","resolution":{"observed_at":"2026-08-10T14:01:55.595446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13301","last_updated":"2024-01-04T19:11:25Z","snapshot_observed_at":"2026-08-09T16:20:23.732146Z","submitted_at":"2023-05-22T17:57:41Z","title":"Training Diffusion Models with Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13301","snapshot_observed_at":"2026-08-10T14:01:55.443608Z","title":"Training diffusion models with reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:55.443608Z"},"links":{"cited_paper":"/paper/2305.13301","citing_paper":"/paper/2501.15781"},"observation_digest":"sha256:9844ef62dd9f15fa1ca6b1ec693771c5dadcea954c9fa7be6df9b832a2221470","observation_id":"72e68d4d-ff6c-4b3f-92ab-09c6ccb0d56b","resolution":{"observed_at":"2026-08-10T14:01:55.443608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-10T14:01:55.479125Z","title":"Bert: Pre-training of deep bidirectional trans- formers for language understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:55.479125Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2501.15781"},"observation_digest":"sha256:f7c597103e0a76b274b4e14d242f29219efb2e50aabf02add78999ba901b3943","observation_id":"7df26a61-c997-4f39-85b1-fef3e59d199e","resolution":{"observed_at":"2026-08-10T14:01:55.479125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-10T14:01:55.469284Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:55.469284Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2501.15781"},"observation_digest":"sha256:6d262a4cd354a46675619293f775c385b4079413ff40bde05e35d1ff051343de","observation_id":"52723c5c-5d5c-4b82-b8dc-15070798301b","resolution":{"observed_at":"2026-08-10T14:01:55.469284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-10T14:01:55.448525Z","title":"V ., R´e, C., and Mirhoseini, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:55.448525Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2501.15781"},"observation_digest":"sha256:20688b102916c08a335c85a7ebf1c1a1b20301c55ff883272f7d1354af675aa2","observation_id":"d4d9172a-4a47-421c-bcd3-8ffbf6bf7622","resolution":{"observed_at":"2026-08-10T14:01:55.448525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13673","last_updated":"2025-05-19T11:12:27Z","snapshot_observed_at":"2026-08-10T12:48:03.439090Z","submitted_at":"2023-05-23T04:28:16Z","title":"Physics of Language Models: Part 1, Learning Hierarchical Language Structures","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13673","snapshot_observed_at":"2026-08-10T14:01:55.438176Z","title":"and Li, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:55.438176Z"},"links":{"cited_paper":"/paper/2305.13673","citing_paper":"/paper/2501.15781"},"observation_digest":"sha256:7bb55c0d1b6bf96973f49157b194338775741c7fe66014b80053d805e1b18fd2","observation_id":"4ee9f97f-a8e5-432f-83ff-2a5344107271","resolution":{"observed_at":"2026-08-10T14:01:55.438176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17432","last_updated":"2023-06-26T22:31:06Z","snapshot_observed_at":"2026-08-08T10:55:08.646488Z","submitted_at":"2022-10-31T16:02:00Z","title":"SSD-LM: Semi-autoregressive Simplex-based Diffusion Language Model for Text Generation and Modular Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17432","snapshot_observed_at":"2026-08-10T14:01:55.507922Z","title":"Ssd-lm: Semi- autoregressive simplex-based diffusion language model for text generation and modular control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-10T14:01:55.507922Z"},"links":{"cited_paper":"/paper/2210.17432","citing_paper":"/paper/2501.15781"},"observation_digest":"sha256:6e39985fbd4cfdb69412606064eba97f93fd8d37f24676a6e4318e3636d5e0cd","observation_id":"f3590b99-9d32-4452-b3e9-b4da9875af97","resolution":{"observed_at":"2026-08-10T14:01:55.507922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.15781","last_updated":"2025-06-03T11:52:35Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-10T20:56:18.984497Z","submitted_at":"2025-01-27T04:59:29Z","title":"Large Language Models to Diffusion Finetuning"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":51,"verified_exact":0,"verified_fuzzy":4},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 2 inbound Pith citation observations for arXiv:2501.15781."}