{"as_of":"2026-08-10T02:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b68273a7c7492843077aedc316683dbac32df48deaea1ae6389cdd9af01ee7eb","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:10:22.241118Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T13:10:37.285667Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T20:03:56.729210Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"cited_work":{"arxiv_id":"2507.14503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.14503","snapshot_observed_at":"2026-06-29T20:03:56.729210Z","title":"arXiv preprint arXiv:2507.14503 (2025)","venue":null,"work_id":"11c3053e-984d-49da-9352-a51f1f500b09","year":2025},"citing_paper":{"arxiv_id":"2606.27696","last_updated":"2026-06-26T03:43:23Z","snapshot_observed_at":"2026-08-01T09:05:02.081880Z","submitted_at":"2026-06-26T03:43:23Z","title":"Class-frequency Guided Noise Schedule for Diffusion Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-29T04:35:43.680865Z"},"links":{"cited_paper":"/paper/2507.14503","citing_paper":"/paper/2606.27696"},"observation_digest":"sha256:448b3274979b79284a3f1c6632648bb39cedb0df2ef0a85f187500ed6f7595eb","observation_id":"43f35ce3-9858-4652-941e-00e68dc4085e","resolution":{"observed_at":"2026-06-29T20:03:56.730958Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.14503","snapshot_observed_at":"2026-08-01T13:10:37.285667Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22716","last_updated":"2026-07-21T15:52:30Z","snapshot_observed_at":"2026-08-06T12:10:57.542923Z","submitted_at":"2026-07-21T15:52:30Z","title":"Visual Token Compression Enhances Robustness of MLLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T13:10:37.285667Z"},"links":{"cited_paper":"/paper/2507.14503","citing_paper":"/paper/2607.22716"},"observation_digest":"sha256:c98c172b5420e6e8f48035a6c99ffb67627ca19fc74899f1c3a572bb79a9c893","observation_id":"a25eee4c-821e-4e41-ac0d-395d08dabaec","resolution":{"observed_at":"2026-08-01T13:10:37.285667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.14503/citation-record","integrity":"/paper/2507.14503/integrity","json":"/paper/2507.14503/citation-record.json","paper":"/paper/2507.14503"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:10:22.003486Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.003486Z"},"links":{"citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:2358b09eb2c2eb2572128259c389b6e1752f4571711908dd351aa4918ae39d16","observation_id":"00289b22-9a01-4fce-9e55-b243a350392b","resolution":{"observed_at":"2026-08-06T16:10:22.003486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T16:10:22.008628Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.008628Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:2ff4248c393ee7dae1f6e479f5841c6846de97d4f3bef41953195a0dfe742732","observation_id":"e75a3e5a-5a75-4bf8-8afe-1fe0368fbfc5","resolution":{"observed_at":"2026-08-06T16:10:22.008628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09573","last_updated":"2025-05-17T21:15:02Z","snapshot_observed_at":"2026-08-03T23:49:05.512328Z","submitted_at":"2025-03-12T17:43:40Z","title":"Block Diffusion: Interpolating Between Autoregressive and Diffusion Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09573","snapshot_observed_at":"2026-08-06T16:10:22.012591Z","title":"Block diffusion: Interpolating between autoregressive and diffusion language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.012591Z"},"links":{"cited_paper":"/paper/2503.09573","citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:dafbe6b53fb226657b04570f0c7e6c69010d34f7aecc62698f1c05aedba040e4","observation_id":"92232be3-ae4b-4912-9060-de10d2f25e78","resolution":{"observed_at":"2026-08-06T16:10:22.012591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:10:22.017288Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.017288Z"},"links":{"citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:8238135a86ab7ebdf735d5f06234a5b054af168d1d873b7d1cca373563863299","observation_id":"6c15bad7-8834-4eba-a88b-9381ba73faee","resolution":{"observed_at":"2026-08-06T16:10:22.017288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:10:22.021410Z","title":"Learning imbalanced datasets with label-distribution-aware margin loss","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.021410Z"},"links":{"citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:c1894165e676b1a3fabb87f8ff586b831eadb20c0ee3fd2975447f5794e6fa63","observation_id":"bea7b8f3-bfb6-4c2f-abdd-884232b29721","resolution":{"observed_at":"2026-08-06T16:10:22.021410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:10:22.924121Z","title":"Conceptual 12m: Pushing web-scale image-text pre-training to recognize long-tail visual concepts","venue":null,"work_id":"2156a761-fc7b-4ba4-8719-215eeef182b8","year":2021},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.025224Z"},"links":{"citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:3a1889c6fc86579786caaf9034bd4f1d3f65164b5f8aff726882bcf57aebf1a3","observation_id":"c9a3e461-a7c8-4daf-89e3-101fc97fb431","resolution":{"observed_at":"2026-08-06T16:10:22.928887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:10:22.912314Z","title":"Distilling knowledge via knowledge review","venue":null,"work_id":"8e059f78-873b-4b7f-b43e-96ea212acbde","year":2021},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.029135Z"},"links":{"citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:1611f47591a0f0600b85a23d25dc6dc4f0eb5ceba09df28d70d0ac4c4479f3c7","observation_id":"38b89597-0092-4e95-9ad1-3aa43af21e20","resolution":{"observed_at":"2026-08-06T16:10:22.916413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:10:22.898523Z","title":"On the efficacy of knowledge distillation","venue":null,"work_id":"1e058355-3a70-4d30-aec6-09335e1bf7dd","year":2019},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.033377Z"},"links":{"citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:446bff4c007c78f4d35fc47b8412d215f761642876e3f508b8560e380fb3a81a","observation_id":"2c559846-f796-41e5-a87a-a98f8120ed8e","resolution":{"observed_at":"2026-08-06T16:10:22.903687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:10:22.885300Z","title":"Parametric contrastive learning","venue":null,"work_id":"def4d0f2-0cc9-462b-a4df-767a3146a22a","year":2021},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.037614Z"},"links":{"citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:e0a53eae17e6637c95385a51635f9330a31b9c2143d0b671c779783bd5b7b3da","observation_id":"a3e3816c-b831-4764-a3fd-997e1cf27707","resolution":{"observed_at":"2026-08-06T16:10:22.889608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:10:22.872665Z","title":"Reslt: Residual learning for long-tailed recognition","venue":null,"work_id":"b2e0a95d-41b1-4391-a8b9-2981d97ff0b0","year":2022},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.042361Z"},"links":{"citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:cb8f42d61512e9f94fe68d5559342f4ad257583be1af3e4c0e71c95c76ede5ae","observation_id":"af72f74d-c777-4fef-84f7-313a4d224f59","resolution":{"observed_at":"2026-08-06T16:10:22.876823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:10:22.860574Z","title":"Generalized parametric contrastive learning","venue":null,"work_id":"4ae48de7-6ac3-476a-8385-090c4067b607","year":2023},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.046863Z"},"links":{"citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:ab7f6af5d0bf584f358d8a6cfd4ebd70fdc133a71bf5d8025350aac408340e2b","observation_id":"cb1e7e5c-3c98-4810-9a00-17c5e96b9d17","resolution":{"observed_at":"2026-08-06T16:10:22.864786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:10:22.846758Z","title":"Decoupled kullback-leibler divergence loss","venue":null,"work_id":"d1e7f8a3-1d13-40df-857a-76731a9ec70c","year":2024},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.050403Z"},"links":{"citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:6e5c014a3594b3ea890abe3efd590e7b6d6e43a9e7a1deb8b661e673b00598b7","observation_id":"bbed58e5-729f-4d75-a157-d726204359a4","resolution":{"observed_at":"2026-08-06T16:10:22.851884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:10:22.834565Z","title":"Classes are not equal: An empirical study on image recognition fairness","venue":null,"work_id":"f0f4d443-e41b-4369-879b-6826748bf539","year":2024},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.054032Z"},"links":{"citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:00b69468f36430326408d464b028ac5ca99c381f51b39ad1025c110c02c20fe6","observation_id":"7068f846-0d6e-4587-8529-0f0a2b191f41","resolution":{"observed_at":"2026-08-06T16:10:22.839435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08038","last_updated":"2026-06-17T04:01:34Z","snapshot_observed_at":"2026-08-07T17:14:23.408124Z","submitted_at":"2025-03-11T04:43:33Z","title":"Generalized Kullback-Leibler Divergence Loss","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08038","snapshot_observed_at":"2026-08-06T16:10:22.057881Z","title":"Generalized kullback-leibler divergence loss","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.057881Z"},"links":{"cited_paper":"/paper/2503.08038","citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:aafbb93e3fed16ffd7bcb1758ec93a347fd0bff774595ae69e743255e2c839b6","observation_id":"a3aa7c05-a9a2-46cd-980e-5f719d207598","resolution":{"observed_at":"2026-08-06T16:10:22.057881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:10:22.061740Z","title":"Class-balanced loss based on effective number of samples","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.061740Z"},"links":{"citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:4da9886b0f42b0d86c5f9b90a180f6aad050c5882e9cc4d6b6905769a4924665","observation_id":"c036e058-5be9-49ed-be49-4d3ff8d0a571","resolution":{"observed_at":"2026-08-06T16:10:22.061740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:10:22.065193Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.065193Z"},"links":{"citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:b899afb82ff922abc0d9d749528250b9ec44bff4d2c551a41e0bb01a11aa461e","observation_id":"e2c9e902-8dd8-4fa0-9d59-7507c1334178","resolution":{"observed_at":"2026-08-06T16:10:22.065193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13436","last_updated":"2025-03-17T17:58:30Z","snapshot_observed_at":"2026-08-07T16:57:02.267787Z","submitted_at":"2025-03-17T17:58:30Z","title":"Unified Autoregressive Visual Generation and Understanding with Continuous Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13436","snapshot_observed_at":"2026-08-06T16:10:22.068784Z","title":"Unified autoregressive visual generation and understanding with continuous tokens","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.068784Z"},"links":{"cited_paper":"/paper/2503.13436","citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:66d702084e54154b1847c811b38e00cb00152efadb17237f0ff51cb1ed37f57c","observation_id":"3e050806-5d68-47c6-a051-591c3ae8a5e5","resolution":{"observed_at":"2026-08-06T16:10:22.068784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:10:22.808756Z","title":"Born again neural networks","venue":null,"work_id":"07d68ade-5a57-472e-b1e5-0b9eccaf1ed6","year":2018},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.072865Z"},"links":{"citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:ac54202048cc8605d7afdd2855479a54c4c3fab459524a1ce256aeb6561b6bb7","observation_id":"7ce6a014-960d-44e6-8e67-699c1f7bd170","resolution":{"observed_at":"2026-08-06T16:10:22.812952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:10:22.077223Z","title":"Discrete flow matching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.077223Z"},"links":{"citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:4e0cc74df16f809815e7adb11e2eb4e904dd85d9071c4476f76c5566d4636cbe","observation_id":"1a0263c8-1df2-4af6-8423-cc57ee6ad496","resolution":{"observed_at":"2026-08-06T16:10:22.077223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13447","last_updated":"2025-05-19T17:59:42Z","snapshot_observed_at":"2026-08-09T12:36:49.059190Z","submitted_at":"2025-05-19T17:59:42Z","title":"Mean Flows for One-step Generative Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13447","snapshot_observed_at":"2026-08-06T16:10:22.081213Z","title":"Mean flows for one-step generative modeling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.081213Z"},"links":{"cited_paper":"/paper/2505.13447","citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:9f1206d0efd4abd8aadeeb2306e9090769a9e490a909ac136c05188e77b04b42","observation_id":"006f0252-7cd0-4ee8-8d52-78adc277af6e","resolution":{"observed_at":"2026-08-06T16:10:22.081213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15781","last_updated":"2023-05-25T06:50:08Z","snapshot_observed_at":"2026-07-06T15:33:06.904026Z","submitted_at":"2023-05-25T06:50:08Z","title":"VanillaKD: Revisit the Power of Vanilla Knowledge Distillation from Small Scale to Large Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15781","snapshot_observed_at":"2026-08-06T16:10:22.085588Z","title":"Vanillakd: Revisit the power of vanilla knowledge distillation from small scale to large scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.085588Z"},"links":{"cited_paper":"/paper/2305.15781","citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:2a11f5f89e2f2bad9e41efb71c6752122765403ecc8c1617985fa920e9cf23aa","observation_id":"88a44338-3450-4ef8-ae08-fdebcd383331","resolution":{"observed_at":"2026-08-06T16:10:22.085588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:10:22.789943Z","title":"A comprehensive overhaul of feature distillation","venue":null,"work_id":"1c67a611-b5b8-4d0b-9087-4fe750b6cfe3","year":2019},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.090370Z"},"links":{"citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:164ccea4bbb14ce96819353936d1dbcfcad2c9a37b777065d3a6b7159c6bbb5a","observation_id":"19a85b92-d408-4e48-8e06-8e1cc22b1b26","resolution":{"observed_at":"2026-08-06T16:10:22.794596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:10:22.094240Z","title":"Distilling the knowledge in a neural network","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.094240Z"},"links":{"citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:459320adb341a22a57485bac3b4cc84cf7e94b1ab8036be343c3f468f30bad36","observation_id":"8188e776-6479-4440-b267-84713b8ea9d3","resolution":{"observed_at":"2026-08-06T16:10:22.094240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:10:22.097806Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.097806Z"},"links":{"citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:aa2e76f40a05f1ddb4d5114a668b5141e7c0c1411ad5ed15e3041cfafc874604","observation_id":"fd7a3f07-4624-483c-b074-1f4fa2968962","resolution":{"observed_at":"2026-08-06T16:10:22.097806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:10:22.762821Z","title":"Knowledge distillation from a stronger teacher","venue":null,"work_id":"efb51092-0a1d-40aa-9e0f-0b38b200a1d1","year":2022},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.101195Z"},"links":{"citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:355eec94a317774acd2ea021cb62493b5524a1f51ee352538840980325f48f34","observation_id":"ec8ea7dd-be06-4e09-85f6-b5763bd811ba","resolution":{"observed_at":"2026-08-06T16:10:22.767913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:10:22.750132Z","title":"Knowledge diffusion for distillation","venue":null,"work_id":"2c29bd8a-5719-4a46-b761-9f2a9ed1c61b","year":2023},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.104694Z"},"links":{"citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:8aa3ee00a1433dc2e72b0b7613d8573afec75505a84bb2fa00c750ebc4bf3d59","observation_id":"a9a4a2a2-52d5-48d4-98e3-bf6f768257e8","resolution":{"observed_at":"2026-08-06T16:10:22.754087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.09217","last_updated":"2020-02-19T15:51:25Z","snapshot_observed_at":"2026-08-06T17:14:21.920122Z","submitted_at":"2019-10-21T09:03:19Z","title":"Decoupling Representation and Classifier for Long-Tailed Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.09217","snapshot_observed_at":"2026-08-06T16:10:22.108808Z","title":"Decoupling representation and classifier for long-tailed recognition","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.108808Z"},"links":{"cited_paper":"/paper/1910.09217","citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:6e582907287d8a6ca31b7d46cdb98b007aaf682de438a95e4a00f4acd2e0f1dc","observation_id":"0ec7153e-f242-4d93-9ef7-0c14dc41a800","resolution":{"observed_at":"2026-08-06T16:10:22.108808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:10:22.113263Z","title":"Auto-encoding variational bayes, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.113263Z"},"links":{"citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:d906f075fe0b97798946c6c198ff20718733f78395c178f83e7a30dd4cbd6b8c","observation_id":"1b041e38-2dcc-45e6-869c-9681aea10e5a","resolution":{"observed_at":"2026-08-06T16:10:22.113263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:10:22.730637Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":"5701ee3e-4440-4690-9c38-677176198f4b","year":2009},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.117309Z"},"links":{"citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:99f4e21b65f3fdb90244a618b1b4bd8358aedff71a428af2d9e126b2d88d0327","observation_id":"214f586e-9b62-407b-a563-84a44a445fdb","resolution":{"observed_at":"2026-08-06T16:10:22.735041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:10:22.122073Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.122073Z"},"links":{"citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:6c933d6f9b13f4d354546376870866e8deeafd087b115f909b39366bc95dd8e7","observation_id":"9fa548b9-554e-4523-9622-1f5ab9e43d61","resolution":{"observed_at":"2026-08-06T16:10:22.122073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:10:22.710971Z","title":"Autoregressive image generation without vector quantization","venue":null,"work_id":"787838d6-9f8f-48e0-90a7-09e2dbc3e1b0","year":2024},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.126506Z"},"links":{"citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:657865cb7cc448edbf2a22742d2e5ee9453c1a0aa4496ea5daffd07f88a42d1e","observation_id":"7f5dce79-1515-414e-8f72-053a2cfb79bb","resolution":{"observed_at":"2026-08-06T16:10:22.715411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-06T16:10:22.130843Z","title":"Flow matching for generative modeling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.130843Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:32b0fbd8c3c3bf8e2d3e0ffe13ba919dbe76f19d06d328e699ad9958969b79a6","observation_id":"1c8be4b6-91e9-4ad8-a6ce-16fcf63514da","resolution":{"observed_at":"2026-08-06T16:10:22.130843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:10:22.135732Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.135732Z"},"links":{"citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:6aa8bf0ef06ab9cd5106771158f008bcd8a34c41a67f3dd87c9966a30f1b9d3d","observation_id":"f6a1a124-cc38-44e4-b5ef-24bde7a1e720","resolution":{"observed_at":"2026-08-06T16:10:22.135732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:10:22.689299Z","title":"Large-scale long-tailed recognition in an open world","venue":null,"work_id":"df4dc05a-402b-487e-be79-562f0fc8b3d8","year":2019},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.140331Z"},"links":{"citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:d5b87b4ce8ee0962dcbb76f79563530281c3bd6807d65e5057964abcced5caec","observation_id":"f241c782-b1e0-425b-bf30-ad6221574c1d","resolution":{"observed_at":"2026-08-06T16:10:22.693359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:10:22.677011Z","title":"Wasserstein distance rivals kullback-leibler divergence for knowledge distillation","venue":null,"work_id":"282f3199-b654-4e8c-aaa9-48989bc69ffd","year":2024},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.144802Z"},"links":{"citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:158c34cd6d997ddf2d861afe4ab8431a5118c686527890cd49c96b6244072df7","observation_id":"b416ad32-b37e-4f61-9367-693f00d2a378","resolution":{"observed_at":"2026-08-06T16:10:22.681697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.07314","last_updated":"2021-07-09T21:23:25Z","snapshot_observed_at":"2026-08-08T11:03:52.719052Z","submitted_at":"2020-07-14T19:27:13Z","title":"Long-tail learning via logit adjustment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.07314","snapshot_observed_at":"2026-08-06T16:10:22.148947Z","title":"Long-tail learning via logit adjustment","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.148947Z"},"links":{"cited_paper":"/paper/2007.07314","citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:819dc411ef34bc0c3b1a3476e4957af7e0a30fe77a003fd45b8b98f483413099","observation_id":"793a43ec-dedc-4571-a3ef-88b76e5c22c8","resolution":{"observed_at":"2026-08-06T16:10:22.148947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:10:22.153518Z","title":"Improved denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.153518Z"},"links":{"citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:8749cd3a69903a1011958b85b636fc14e8b859948eacd34415fcac14d6e52d9d","observation_id":"8edff2ae-a6be-4d4b-a334-11eec92b15c6","resolution":{"observed_at":"2026-08-06T16:10:22.153518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:10:22.157695Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.157695Z"},"links":{"citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:ee2613ac882966e04f29df5d87282b42ca203c95abc1b3c80b1069e92daa7241","observation_id":"11687084-e6de-4d79-90c5-a0d3e5ac1e2d","resolution":{"observed_at":"2026-08-06T16:10:22.157695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:10:22.648655Z","title":"Relational knowledge distillation","venue":null,"work_id":"0a9300fa-295e-4446-a629-8c53cc8c12d5","year":2019},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.161480Z"},"links":{"citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:b0e9c7ca4b80b3f2da46597a12e9ed9d1298b6e94652030490caf50a518a5381","observation_id":"dbabca6d-069b-4a48-8611-ec504db73496","resolution":{"observed_at":"2026-08-06T16:10:22.652884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:10:22.165154Z","title":"Improving language understanding by generative pre-training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.165154Z"},"links":{"citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:e1c892df774cf8c0780b6a35e4c3bacfa946695a4952d4a12c3a0e3121a4979d","observation_id":"c6efe5a0-ae41-44b0-a7d5-3ccb31c3d847","resolution":{"observed_at":"2026-08-06T16:10:22.165154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:10:22.168579Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.168579Z"},"links":{"citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:8e867bc2b7370de9e2cca14d42625a380c024302e789f504f27e08f5a1a66d89","observation_id":"002596e8-6f15-40dd-a7c5-8e65454d629a","resolution":{"observed_at":"2026-08-06T16:10:22.168579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:10:22.173215Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.173215Z"},"links":{"citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:5354840d500795d8ab914211ce9d90e43b1d13974d827ef7bdd0de7763507caf","observation_id":"a16ff439-282b-4042-af76-68bda21fd743","resolution":{"observed_at":"2026-08-06T16:10:22.173215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:10:22.177835Z","title":"Fitnets: Hints for thin deep nets","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.177835Z"},"links":{"citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:b77bb10c9265fc313dbbcb5feed9ea801fee152eb9a5bbb6aee851d80dd559c1","observation_id":"a8fd183a-1581-4d05-afed-8bf040627c11","resolution":{"observed_at":"2026-08-06T16:10:22.177835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:10:22.601272Z","title":"Image N et large scale visual recognition challenge","venue":null,"work_id":"fd1f6330-a205-4b8a-8955-7c3d5f78c8eb","year":2015},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.181677Z"},"links":{"citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:2978996231e5e884a5b8930eba6b11f97b52e10549eb71e3da7ca6937a94b634","observation_id":"fd61dea6-788b-42bf-8dfc-c3e38ab2d0cf","resolution":{"observed_at":"2026-08-06T16:10:22.605528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:10:22.185332Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.185332Z"},"links":{"citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:3854c96f145d060de3754eeb9c543ac2bc41c219f2bc13667171b1885a3b5551","observation_id":"c39baa72-671a-4e44-b30b-6d37219c993b","resolution":{"observed_at":"2026-08-06T16:10:22.185332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-06T16:10:22.188899Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.188899Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:254cc0f52260c6e4bc07ccfb96a911bb3c422b4707a63e7ad5484e0047ba5d19","observation_id":"2da85518-a297-445b-a8b5-47aeeb926d64","resolution":{"observed_at":"2026-08-06T16:10:22.188899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:10:22.578636Z","title":"Generative modeling by estimating gradients of the data distribution","venue":null,"work_id":"fe5319f9-9509-4b99-9fb0-85c28f11e8c9","year":2019},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.192795Z"},"links":{"citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:f707b4af564cd0ae7de4b7b179e8f60fa8235e56e777bb43a54655a71b2882de","observation_id":"62f5f4f6-24be-449f-ac5c-12d0bc37da7f","resolution":{"observed_at":"2026-08-06T16:10:22.583872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-06T16:10:22.196299Z","title":"Score-based generative modeling through stochastic differential equations","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.196299Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:ac4946ae4ca060160639cc4ca3b82d74a53e81a2f8d1743abeb9226e74679430","observation_id":"180062ff-4614-4e6f-83ac-0597f6a140fc","resolution":{"observed_at":"2026-08-06T16:10:22.196299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:10:22.563857Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction","venue":null,"work_id":"8530819f-7be0-4276-9566-0590b68b7d96","year":2024},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.200377Z"},"links":{"citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:39e3192a90b53366395c1055a4fece5b411a2977ad28d79fcf4e814fde71e6d5","observation_id":"5c7edff9-837a-4e9f-9bbc-efce08b68baf","resolution":{"observed_at":"2026-08-06T16:10:22.569615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:10:22.549940Z","title":"Contrastive representation distillation","venue":null,"work_id":"832d2f98-e4b4-4136-b8b1-279b596868ea","year":2020},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.204036Z"},"links":{"citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:4ca094b63fb4b24628b9702a67c7073dae7b5ceb6df5ae84cc212f599c728e6b","observation_id":"fcd01fc7-515d-42a8-be76-441b8e4910e6","resolution":{"observed_at":"2026-08-06T16:10:22.554212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04429","last_updated":"2025-03-04T16:31:57Z","snapshot_observed_at":"2026-08-01T23:38:04.510222Z","submitted_at":"2024-09-06T17:49:56Z","title":"VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04429","snapshot_observed_at":"2026-08-06T16:10:22.207798Z","title":"Vila-u: a unified foundation model integrating visual understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.207798Z"},"links":{"cited_paper":"/paper/2409.04429","citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:706ee89e125efab842e439342c2766d563bc17324ff03223bb10c28c36baf402","observation_id":"c0d19935-d655-4c3f-8ad9-56f0e8c967df","resolution":{"observed_at":"2026-08-06T16:10:22.207798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-08-05T05:27:10.277230Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-08-06T16:10:22.212561Z","title":"Mmada: Multimodal large diffusion language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.212561Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:d0b9f207977a2326631789a0a066deabcd702b183d5f486433f06e176af28623","observation_id":"7caf39e7-b05f-461c-8c5f-f2a924b64ee5","resolution":{"observed_at":"2026-08-06T16:10:22.212561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:10:22.535628Z","title":"Deep mutual learning","venue":null,"work_id":"539ce323-1364-4935-ae2b-1cccdc645fd0","year":2018},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.217003Z"},"links":{"citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:42c37dba3585ab781ec501bfdef62b3f90c9c72d14bfe9304b75525d7969d77a","observation_id":"2ce37a5f-7b02-4b0d-b799-7080718b3840","resolution":{"observed_at":"2026-08-06T16:10:22.539452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:10:22.521956Z","title":"Decoupled knowledge distillation","venue":null,"work_id":"7cabe79d-2200-48c0-8b9c-374801d74781","year":2022},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.221371Z"},"links":{"citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:aa5b43f8fc609a41e93f6a25e5e03dd539d47e335fd618e72d90aa4cf3c6b2f2","observation_id":"f683dcb1-7554-4b74-85c2-5a14e5498bee","resolution":{"observed_at":"2026-08-06T16:10:22.526901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-06T16:10:22.225433Z","title":"Transfusion: Predict the next token and diffuse images with one multi-modal model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.225433Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:08f9ff36d90c7ac3439674078fdbf8b5f1c8f215d54dc745556ee286f5c6ed8b","observation_id":"95675ddd-1f5c-4957-bbde-9da3c5876992","resolution":{"observed_at":"2026-08-06T16:10:22.225433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-06T16:10:22.229058Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.229058Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:53293c1b8093b835ed8bc45feb2389a30d3456102bdca609e9f37118f57bbce9","observation_id":"5ecdfa42-a0b2-4026-a4b2-bef8e0b43399","resolution":{"observed_at":"2026-08-06T16:10:22.229058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:10:22.232728Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.232728Z"},"links":{"citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:37f2fef8d53efd358e5b0362a522124b5e8db02d871d6f64ae1195297d2089c9","observation_id":"ff4f5492-4641-485b-b1bc-4151b36a044e","resolution":{"observed_at":"2026-08-06T16:10:22.232728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:10:22.236971Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.236971Z"},"links":{"citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:e52a9bb802972305f91c02d0b0b2bf8bf07f4daf81b17fa9b56fc9e006666000","observation_id":"37ee81bf-89d0-44b2-91a6-804f2d669a6b","resolution":{"observed_at":"2026-08-06T16:10:22.236971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:10:22.241118Z","title":"A naive GenDD baseline encounters two major challenges: the curse of high-dimensional optimization and the lack of semantic supervision from labels","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T16:10:22.241118Z"},"links":{"citing_paper":"/paper/2507.14503"},"observation_digest":"sha256:d366b44db9b62617afd15df797a8ef18fd11ead6d0fc76b0983a14512c1707ec","observation_id":"0081f099-869b-4096-bdc2-e6650e38824c","resolution":{"observed_at":"2026-08-06T16:10:22.241118Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.14503","last_updated":"2025-07-19T06:27:42Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T01:47:26.879462Z","submitted_at":"2025-07-19T06:27:42Z","title":"Generative Distribution Distillation"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":0,"verified_fuzzy":23},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 2 inbound Pith citation observations for arXiv:2507.14503."}