{"as_of":"2026-08-09T17:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8821982c8113ddfc2ae71624b87cc2ae47218ae277335bd0872795b591bdb66d","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:31:08.798977Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T17:14:01.979367Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21780","snapshot_observed_at":"2026-08-02T17:14:01.979367Z","title":"Yanbo Wang, Justin Dauwels, and Yilun Du","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.27958","last_updated":"2026-07-18T22:10:24Z","snapshot_observed_at":"2026-08-09T04:21:06.006709Z","submitted_at":"2026-03-30T02:22:30Z","title":"CARV: A Diagnostic Benchmark for Compositional Analogical Reasoning in Multimodal LLMs","version":2},"reference_index":280,"source":"pdf_text","source_observed_at":"2026-08-02T17:14:01.979367Z"},"links":{"cited_paper":"/paper/2505.21780","citing_paper":"/paper/2603.27958"},"observation_digest":"sha256:9aa2fe906df0ddccca06cd6366b886ee827d1cd27e948c6d028de249ee76d157","observation_id":"4a7ecbc1-5942-4824-b80a-9e3f101176a4","resolution":{"observed_at":"2026-08-02T17:14:01.979367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.21780/citation-record","integrity":"/paper/2505.21780/integrity","json":"/paper/2505.21780/citation-record.json","paper":"/paper/2505.21780"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:03.233292Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:03.233292Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:03ecedc76eeeec9759ed3151564d479111d59cefc1fd3dd78e84ca924b6b87b2","observation_id":"3b31ca26-b0ed-4157-a0a2-6884242e4bf6","resolution":{"observed_at":"2026-08-07T13:31:03.233292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:03.271306Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:03.271306Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:8da5462f33b9b3f6e2d124846bbbade05923c9c8971fd5a90ae354d2249e189c","observation_id":"72888ae0-6451-4d57-a5d6-9b2e39af1e6a","resolution":{"observed_at":"2026-08-07T13:31:03.271306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:03.341825Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:03.341825Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:dfe9f0132e740e2631fd245aa2ebd6c164c53a071092d359c9798741ed87661e","observation_id":"db58fc39-6a82-49be-aa34-9451dc3d7862","resolution":{"observed_at":"2026-08-07T13:31:03.341825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:15.589224Z","title":null,"venue":null,"work_id":"c611c29b-432e-49c1-95b5-258dc0b19be7","year":null},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:03.496031Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:2f9f6134a9a8aaac3a2184dbe2acb7ff446f8af2dea3e5ab1d20015dcfa69e25","observation_id":"bed0d9c1-e908-4e70-8fd0-1091925d713e","resolution":{"observed_at":"2026-08-07T13:31:15.669055Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:15.443117Z","title":"Backpropagation and stochastic gradient descent method","venue":null,"work_id":"830414e9-1b98-405f-8743-d5a8d4d199f9","year":1993},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:03.537550Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:fd1a549db842b8f85fbceceeaed0e0484e6a045dc7748baa351da1897c4c6d9a","observation_id":"44e67614-41f9-41d0-99ca-206e22cd53c8","resolution":{"observed_at":"2026-08-07T13:31:15.518102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00390","last_updated":"2022-09-07T04:14:48Z","snapshot_observed_at":"2026-08-07T15:26:15.477145Z","submitted_at":"2021-12-01T10:17:25Z","title":"SegDiff: Image Segmentation with Diffusion Probabilistic Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.00390","snapshot_observed_at":"2026-08-07T13:31:03.611392Z","title":"Segdiff: Image segmentation with diffusion probabilistic models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:03.611392Z"},"links":{"cited_paper":"/paper/2112.00390","citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:60aef5ee4c7941bd22158d6a0e410019b1106401de8a63a15c63e79d1420b323","observation_id":"5c614754-a8ea-46f4-9e99-7873952088df","resolution":{"observed_at":"2026-08-07T13:31:03.611392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:15.229012Z","title":"Break-a-scene: Extracting multiple concepts from a single image","venue":null,"work_id":"f1a8c825-0d2b-4140-9f89-0977ae4e2a2b","year":2023},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:03.688261Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:0b94938d361a2f4fee9e8171f05b6113c7e84f0eafa2db7746d7ac675b767af0","observation_id":"4df89546-87ce-4569-bbb1-c212e565da7b","resolution":{"observed_at":"2026-08-07T13:31:15.335852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:14.997247Z","title":"Towards compositional understanding of the world by agent-based deep learning","venue":null,"work_id":"96d8fc16-d362-4fcf-9fec-45168245de53","year":2019},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:03.781980Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:3fe0a50ffece12ee2818e4504a4ee2dce7150da109ab0555e2eaaa659a9d48ba","observation_id":"235b3296-d247-4fc6-be10-f2b01069f787","resolution":{"observed_at":"2026-08-07T13:31:15.099294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:14.830002Z","title":"Recognition-by-components: a theory of human image understanding","venue":null,"work_id":"c0bb87af-e658-4e8a-a510-beedaebf9246","year":1987},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:03.851968Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:097dbbbb60ce428b4532cedec7acebb83cc21871ba40a964dc695c3951f6d89d","observation_id":"d444a0d3-fb85-40c2-b20b-cee3d8ecdffc","resolution":{"observed_at":"2026-08-07T13:31:14.910518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:14.660624Z","title":"A., Kornblith, S., Chen, T., Parmar, N., Minderer, M., and Norouzi, M","venue":null,"work_id":"42234110-04a6-4a07-886f-1fba1cca3325","year":2022},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:03.930887Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:d1a9fd73c4f95d67f36ff08fbf0567af348e45d3f54282eae2fd964f0a7f709c","observation_id":"b01a33cc-c4ff-43b5-b85a-a704329e58c5","resolution":{"observed_at":"2026-08-07T13:31:14.749090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02316","last_updated":"2025-02-22T13:23:28Z","snapshot_observed_at":"2026-07-06T17:24:57.402088Z","submitted_at":"2024-02-04T02:09:18Z","title":"Your Diffusion Model is Secretly a Certifiably Robust Classifier","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02316","snapshot_observed_at":"2026-08-07T13:31:04.057874Z","title":"Your diffusion model is secretly a certifiably robust classifier","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:04.057874Z"},"links":{"cited_paper":"/paper/2402.02316","citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:3e3e74c1af1b7da90469574425151e50fecf8a3ecd1275b1ad9e12f33548c026","observation_id":"5ab40c78-8d67-44dc-8205-47d9268e16e6","resolution":{"observed_at":"2026-08-07T13:31:04.057874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.14368","last_updated":"2025-06-30T19:44:40Z","snapshot_observed_at":"2026-08-05T04:28:31.259985Z","submitted_at":"2023-02-28T07:43:00Z","title":"Enhanced Controllability of Diffusion Models via Feature Disentanglement and Realism-Enhanced Sampling Methods","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.14368","snapshot_observed_at":"2026-08-07T13:31:04.154771Z","title":"K., Lu, J., Inouye, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:04.154771Z"},"links":{"cited_paper":"/paper/2302.14368","citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:55fda553e565473836aa66451296ac9d51b3aed0c0252b0ec746f2b090048dff","observation_id":"f14f2db2-43ef-419a-a265-24a8110ab24e","resolution":{"observed_at":"2026-08-07T13:31:04.154771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:14.445435Z","title":"Aspects of the Theory of Syntax","venue":null,"work_id":"2fb507af-604c-443e-9bdb-82220cc66397","year":1965},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:04.266444Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:cc792245e26a29ed1fb46fcd9faf59adb4c80bcc256e12fd5dbf42e27deab6ef","observation_id":"2abf83de-89c8-45bb-ba41-68219f1837a6","resolution":{"observed_at":"2026-08-07T13:31:14.535965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:14.284976Z","title":"and Jaini, P","venue":null,"work_id":"a73a84ae-3c81-401c-970a-e4917bf2d92d","year":2024},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:04.336704Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:d06c7a9d6ecd12fe48446c1c687191ecac078c76e6eeffc29753bd741ae568e2","observation_id":"95f45988-d245-44cf-9d13-f686c5ca4ef5","resolution":{"observed_at":"2026-08-07T13:31:14.351217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.01413","last_updated":"2023-01-04T03:03:08Z","snapshot_observed_at":"2026-08-09T04:20:02.540278Z","submitted_at":"2023-01-04T03:03:08Z","title":"Attribute-Centric Compositional Text-to-Image Generation","version":1},"cited_work":{"arxiv_id":"2301.01413","doi":null,"metadata_source":"pith","pith_arxiv_id":"2301.01413","snapshot_observed_at":"2026-08-07T13:31:09.415742Z","title":"Attribute-Centric Compositional Text-to-Image Generation","venue":"cs.CV","work_id":"a4a5fea6-b510-4c99-8f71-694225da3aa1","year":2023},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:04.454124Z"},"links":{"cited_paper":"/paper/2301.01413","citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:5476b25f132005b65f358be804555c497f881b1c2c17723091e8e6095649cd72","observation_id":"b8596139-f898-4c9a-8c8b-645f962fc9cc","resolution":{"observed_at":"2026-08-07T13:31:09.499395Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01103","last_updated":"2024-06-03T23:30:33Z","snapshot_observed_at":"2026-08-06T10:04:48.366454Z","submitted_at":"2024-02-02T02:40:51Z","title":"Compositional Generative Modeling: A Single Model is Not All You Need","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01103","snapshot_observed_at":"2026-08-07T13:31:04.574358Z","title":"and Kaelbling, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:04.574358Z"},"links":{"cited_paper":"/paper/2402.01103","citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:c17ac026076d9ddb4a686725596e0050162c7979328506894e97ba9c0bc2b962","observation_id":"a0492db3-2538-4a8d-a29b-6ef3ed2e221d","resolution":{"observed_at":"2026-08-07T13:31:04.574358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.08689","last_updated":"2020-06-30T03:25:59Z","snapshot_observed_at":"2026-08-09T07:48:55.578365Z","submitted_at":"2019-03-20T18:34:29Z","title":"Implicit Generation and Generalization in Energy-Based Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.08689","snapshot_observed_at":"2026-08-07T13:31:04.679037Z","title":"and Mordatch, I","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:04.679037Z"},"links":{"cited_paper":"/paper/1903.08689","citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:7a23ccf564982d940c88daaaae371d8142024431c8f67ad86cd4b00be44415d7","observation_id":"3e2cff6b-91bc-40fc-9105-dd73f7582392","resolution":{"observed_at":"2026-08-07T13:31:04.679037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:14.082244Z","title":"Compositional visual generation with energy based models","venue":null,"work_id":"3c2f2829-8167-4796-9bbe-6f0303961ea5","year":2020},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:04.782175Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:6cf5f79d9ae34c75923a866643653f8c12f0769c8e6c1e29c596453a89d4aca1","observation_id":"a7d0bc0e-0f44-4333-a5a2-00c842ba1b0c","resolution":{"observed_at":"2026-08-07T13:31:14.169795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:13.919467Z","title":"J., and Mordatch, I","venue":null,"work_id":"578bdede-2ab5-42f4-b42f-a826f2975277","year":2021},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:04.849905Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:bafdf57aa97fad90232b9672ffcce8387b2601fe43bca829f0164dcb526e6f51","observation_id":"c1e164b3-df9f-4ea9-a0a0-8f27b8a75df3","resolution":{"observed_at":"2026-08-07T13:31:13.992568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11552","last_updated":"2024-09-14T18:55:50Z","snapshot_observed_at":"2026-07-06T14:54:44.947783Z","submitted_at":"2023-02-22T18:48:46Z","title":"Reduce, Reuse, Recycle: Compositional Generation with Energy-Based Diffusion Models and MCMC","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.11552","snapshot_observed_at":"2026-08-07T13:31:04.988457Z","title":"B., Dieleman, S., Fergus, R., Sohl-Dickstein, J., Doucet, A., and Grathwohl, W","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:04.988457Z"},"links":{"cited_paper":"/paper/2302.11552","citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:76c9a9628e2930952ab01554a6735eff7066b59822aef11b6473f31e48b37d07","observation_id":"1060ef90-6c81-49be-a3bf-26be9a2933f7","resolution":{"observed_at":"2026-08-07T13:31:04.988457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05032","last_updated":"2023-02-28T23:46:24Z","snapshot_observed_at":"2026-08-09T14:37:46.826091Z","submitted_at":"2022-12-09T18:30:24Z","title":"Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.05032","snapshot_observed_at":"2026-08-07T13:31:05.077080Z","title":"E., and Wang, W","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:05.077080Z"},"links":{"cited_paper":"/paper/2212.05032","citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:9ec767e5025f9bb145f026eb1c27b4ccd2e001631201083a76953da453cf06c6","observation_id":"79a09370-420d-4963-980c-b96913185d79","resolution":{"observed_at":"2026-08-07T13:31:05.077080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:13.747000Z","title":null,"venue":null,"work_id":"d1f1d7c7-5665-4079-881b-92d437a8c893","year":2002},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:05.152660Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:e55850df880684fcd039267f18394b0bd8bf54be4e36c0fe3d1195b69feb9b09","observation_id":"13f6d604-d44a-456d-8598-fbf083b40b88","resolution":{"observed_at":"2026-08-07T13:31:13.825818Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:13.544850Z","title":null,"venue":null,"work_id":"d1d67986-5e7e-4e35-b318-8886b98d3d06","year":1988},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:05.234718Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:7cc37e8fe2cd270eb13e777c9698a0f0e4630b6a31cbe0bab5a4d32525aef876","observation_id":"6e098382-277a-4290-83e8-f19105d4c1b3","resolution":{"observed_at":"2026-08-07T13:31:13.654837Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01618","last_updated":"2022-08-02T17:50:36Z","snapshot_observed_at":"2026-08-02T23:40:32.342515Z","submitted_at":"2022-08-02T17:50:36Z","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01618","snapshot_observed_at":"2026-08-07T13:31:05.308165Z","title":"H., Chechik, G., and Cohen-Or, D","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:05.308165Z"},"links":{"cited_paper":"/paper/2208.01618","citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:db038e3c011b33182de7c9b367763942333452194073805d8886d89d14a7cc11","observation_id":"367dfec8-b03e-42e2-bf68-514de2876fdc","resolution":{"observed_at":"2026-08-07T13:31:05.308165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:13.354147Z","title":"H., Chechik, G., and Cohen-Or, D","venue":null,"work_id":"0356fc8b-cd17-4e5f-a2d0-e93f4801796e","year":2023},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:05.415209Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:d71849d49118b12213da93e96f6517f2110256b47385a02441217aa0d86a1f63","observation_id":"f51eac6b-6f16-444a-be13-94261d4ea826","resolution":{"observed_at":"2026-08-07T13:31:13.446518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.12231","last_updated":"2022-11-09T23:15:15Z","snapshot_observed_at":"2026-08-02T03:51:09.933624Z","submitted_at":"2018-11-29T15:04:05Z","title":"ImageNet-trained CNNs are biased towards texture; increasing shape bias improves accuracy and robustness","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.12231","snapshot_observed_at":"2026-08-07T13:31:05.524154Z","title":"A., and Brendel, W","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:05.524154Z"},"links":{"cited_paper":"/paper/1811.12231","citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:a15dff9f72222f24c6d30023193fe425f35cd6a2f510bbf8b409da450df1cf3c","observation_id":"49222bc2-0a8b-4740-ba6c-45e320bacec9","resolution":{"observed_at":"2026-08-07T13:31:05.524154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:05.648001Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:05.648001Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:6e99b9e2cad40920848662d52edc3816ccf7b617b96616917619aa4ec807a0d0","observation_id":"ca265ea4-382a-42ae-9ce1-6ba0fcd88e01","resolution":{"observed_at":"2026-08-07T13:31:05.648001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.05208","last_updated":"2020-12-09T18:02:49Z","snapshot_observed_at":"2026-08-07T12:34:15.648511Z","submitted_at":"2020-12-09T18:02:49Z","title":"On the Binding Problem in Artificial Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.05208","snapshot_observed_at":"2026-08-07T13:31:05.704461Z","title":"On the binding problem in artificial neural networks","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:05.704461Z"},"links":{"cited_paper":"/paper/2012.05208","citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:013a5bc97d589223ef9128462a6ac7f23a8b93590cfe9679013f6b2ecec152b8","observation_id":"e3776150-f756-4d3b-a373-1d873a4e8f5f","resolution":{"observed_at":"2026-08-07T13:31:05.704461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:05.788019Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:05.788019Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:e30c2195164b2b09260bc9d688127f670d8ec58818cc68616a24aee120f46c85","observation_id":"8bebc477-734b-4cb9-a431-d2f09b4f17ac","resolution":{"observed_at":"2026-08-07T13:31:05.788019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1610.02136","last_updated":"2018-10-03T07:32:57Z","snapshot_observed_at":"2026-08-02T06:41:33.803920Z","submitted_at":"2016-10-07T04:06:01Z","title":"A Baseline for Detecting Misclassified and Out-of-Distribution Examples in Neural Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.02136","snapshot_observed_at":"2026-08-07T13:31:05.828657Z","title":"and Gimpel, K","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:05.828657Z"},"links":{"cited_paper":"/paper/1610.02136","citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:721bf8cc5c71833a8b7f0690268fa5453d6417189202939eedbc40e109857935","observation_id":"a8610c5c-b5c5-40fa-9ba8-e34bba963126","resolution":{"observed_at":"2026-08-07T13:31:05.828657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:13.187583Z","title":null,"venue":null,"work_id":"ec89c3ee-3564-431f-8a9d-c44aa4bef010","year":2007},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:05.925807Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:417554fcbb959002e36997082b9c60e341ff1e39421d0b1d713916cebd77ae9d","observation_id":"59580d12-5bee-45ea-8c52-a6b9ca4e046d","resolution":{"observed_at":"2026-08-07T13:31:13.238886Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:05.984068Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:05.984068Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:6e6a43aa4d8ffa460ab1709ad88b01a7b0cdc6f4ecc8cda18607599b0a6affc4","observation_id":"df23d9b9-add0-4112-976f-80a22570e8fd","resolution":{"observed_at":"2026-08-07T13:31:05.984068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.09778","last_updated":"2023-02-22T02:14:55Z","snapshot_observed_at":"2026-08-06T12:21:57.779550Z","submitted_at":"2023-02-20T05:48:41Z","title":"Composer: Creative and Controllable Image Synthesis with Composable Conditions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.09778","snapshot_observed_at":"2026-08-07T13:31:06.090945Z","title":"Composer: Creative and controllable image synthesis with composable conditions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:06.090945Z"},"links":{"cited_paper":"/paper/2302.09778","citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:3a0ebd7c5e063ddd3733ecd96489c03203b04f154fb114f3eefca346c254a03e","observation_id":"45be940d-46e5-496a-8cc3-9109a7fed01a","resolution":{"observed_at":"2026-08-07T13:31:06.090945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16779","last_updated":"2024-02-14T17:54:04Z","snapshot_observed_at":"2026-07-06T16:25:09.382064Z","submitted_at":"2023-09-28T18:19:40Z","title":"Intriguing properties of generative classifiers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16779","snapshot_observed_at":"2026-08-07T13:31:06.162857Z","title":"Intriguing properties of generative classifiers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:06.162857Z"},"links":{"cited_paper":"/paper/2309.16779","citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:aff6bd2aba0d82ad6753c0b52788ebfa433791592c271a84c450191883339caa","observation_id":"554cc24b-a1fb-4947-91b1-b5519e8651d0","resolution":{"observed_at":"2026-08-07T13:31:06.162857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:06.240587Z","title":"Clevr: A diagnostic dataset for compositional language and elementary visual reasoning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:06.240587Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:bcb337f05ec0f9a8e2cb7f49fe2d0b4de0bed2b664a7c0fdcd87c70eaad33d65","observation_id":"273b6cba-1c48-4de2-9f81-c78146dda2cf","resolution":{"observed_at":"2026-08-07T13:31:06.240587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.10265","last_updated":"2021-11-19T15:11:25Z","snapshot_observed_at":"2026-07-06T12:10:13.301883Z","submitted_at":"2021-11-19T15:11:25Z","title":"ClevrTex: A Texture-Rich Benchmark for Unsupervised Multi-Object Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.10265","snapshot_observed_at":"2026-08-07T13:31:06.382571Z","title":"Clevrtex: A texture-rich benchmark for unsupervised multi-object segmentation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:06.382571Z"},"links":{"cited_paper":"/paper/2111.10265","citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:8dc352f8536b2b41d51b65ed95039a2c24f5365429f7d18ad1dd5cf1111550ef","observation_id":"8851ddb0-7794-4e88-be4e-17a33d7171e9","resolution":{"observed_at":"2026-08-07T13:31:06.382571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:06.491365Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:06.491365Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:ce39473d724976df0abccd1dd3b60b9527e3ecdb18ad409992ed532be1e55bf5","observation_id":"c9ffdb28-261d-4adf-8e23-0c4b3bd4e298","resolution":{"observed_at":"2026-08-07T13:31:06.491365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:06.555315Z","title":null,"venue":null,"work_id":null,"year":1955},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:06.555315Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:65ae969f1f26c274612fac46e0fe9095c9bb8617a85c848b8a71df6bea647932","observation_id":"2817ab60-5403-4eb8-9dfb-73e2a688453d","resolution":{"observed_at":"2026-08-07T13:31:06.555315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:13.020427Z","title":"C., Prabhudesai, M., Duggal, S., Brown, E., and Pathak, D","venue":null,"work_id":"0b574f6b-63ce-41c1-a743-af8437f6ba82","year":2023},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:06.719154Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:1fee70eab5707a6f1ae610ad0ba7377a701624d61c7224f78be1c1b93868f314","observation_id":"58e1c2e4-f2fe-4fd3-9074-5a8e2d75a84c","resolution":{"observed_at":"2026-08-07T13:31:13.060318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:12.792285Z","title":"C., Kumar, A., and Pathak, D","venue":null,"work_id":"63377bfa-9fb4-43bd-9ba2-3e8e211f0839","year":2024},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:06.870277Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:bce1c2d1b7c0eccefbb6798ff4c32f329a9329943d3793ae895cf87bb74787a9","observation_id":"5ec24706-9ccd-4cfe-84ed-8939a7a7ecad","resolution":{"observed_at":"2026-08-07T13:31:12.884452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:12.562417Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"6cf16e3b-6d74-4c90-b99a-8421fe0ec038","year":2023},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:06.970144Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:e62a99f1413eebc6fc2f2dec1775146ad4243c1efca77fb41cf41eac00eebb0f","observation_id":"7f4bea38-a0d3-4066-bd3b-ec790830628d","resolution":{"observed_at":"2026-08-07T13:31:12.683474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11522","last_updated":"2022-10-20T18:46:31Z","snapshot_observed_at":"2026-07-06T14:08:26.493996Z","submitted_at":"2022-10-20T18:46:31Z","title":"Composing Ensembles of Pre-trained Models via Iterative Consensus","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.11522","snapshot_observed_at":"2026-08-07T13:31:07.083418Z","title":"B., Torralba, A., and Mordatch, I","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:07.083418Z"},"links":{"cited_paper":"/paper/2210.11522","citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:599a47fa6ca03ad3b4437fe8f97494cc41e4afd4ebdf8edd6523bb262bf696a0","observation_id":"72cccb25-29bc-499c-b59b-04a1bc484905","resolution":{"observed_at":"2026-08-07T13:31:07.083418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:07.232798Z","title":"Learning to compose visual relations","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:07.232798Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:93a354362a3721e5bda12171a0d3e53dcef9490b2ce4ab28a23bbbca576d49d8","observation_id":"69fbf829-3e1a-4605-9303-4368ced9d9c5","resolution":{"observed_at":"2026-08-07T13:31:07.232798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.01714","last_updated":"2023-01-17T17:08:51Z","snapshot_observed_at":"2026-08-02T04:13:10.260957Z","submitted_at":"2022-06-03T17:47:04Z","title":"Compositional Visual Generation with Composable Diffusion Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.01714","snapshot_observed_at":"2026-08-07T13:31:07.277041Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:07.277041Z"},"links":{"cited_paper":"/paper/2206.01714","citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:4bb464f5dc2554fa6c97d6708ab4d63babea34a2b8d36984f9ac3240881f9e3b","observation_id":"3b9d7ced-726c-4517-a0eb-5e95ce7da35f","resolution":{"observed_at":"2026-08-07T13:31:07.277041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:12.370114Z","title":"B., and Torralba, A","venue":null,"work_id":"f377d1a8-3cab-4ef1-a5ef-57f927e74f91","year":2023},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:07.308486Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:54893d2d53fe864c97b14e958a5a84c0bfcd28bf471c6e39fad402b2382bd8d9","observation_id":"0fcc8820-a7d2-446d-aa89-fd5f48eb31fd","resolution":{"observed_at":"2026-08-07T13:31:12.461689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:12.162558Z","title":"Deep learning face attributes in the wild","venue":null,"work_id":"ecc50e10-c9b7-4a8f-8c9a-4f4f2ce38b7d","year":2015},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:07.357725Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:33a19789a4ec6fa18be9fd003f63f8c6ee69f2d4ca9e161b6c6265592cb469f1","observation_id":"24c7118d-6ac1-4175-9763-57546c0daedf","resolution":{"observed_at":"2026-08-07T13:31:12.234536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:07.403281Z","title":"Object-centric learning with slot attention, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:07.403281Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:12f09dd9fce2bcef573fd60f3e8a6979d670ec0ee4265b1250d3e1f718e2006e","observation_id":"7282a1cd-5216-43e9-bce9-21f4e556e220","resolution":{"observed_at":"2026-08-07T13:31:07.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06303","last_updated":"2025-07-10T22:00:10Z","snapshot_observed_at":"2026-07-06T19:30:00.101083Z","submitted_at":"2024-10-08T19:25:07Z","title":"Compositional Risk Minimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06303","snapshot_observed_at":"2026-08-07T13:31:07.462880Z","title":"Compositional risk minimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:07.462880Z"},"links":{"cited_paper":"/paper/2410.06303","citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:9ffb1aab2cde5c7b16267216c15372660819399771f5ebe64cad17306a520ca0","observation_id":"779232eb-934c-4d22-96cd-ef114a936929","resolution":{"observed_at":"2026-08-07T13:31:07.462880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04987","last_updated":"2025-01-13T18:24:22Z","snapshot_observed_at":"2026-07-06T19:46:54.707852Z","submitted_at":"2024-11-07T18:55:10Z","title":"Few-Shot Task Learning through Inverse Generative Modeling","version":2},"cited_work":{"arxiv_id":"2411.04987","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04987","snapshot_observed_at":"2026-08-07T13:31:09.039158Z","title":"Few-Shot Task Learning through Inverse Generative Modeling","venue":"cs.AI","work_id":"e29c0cac-c471-4895-981f-afb7e556db53","year":2024},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:07.512923Z"},"links":{"cited_paper":"/paper/2411.04987","citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:a34588aea9e36acd0a13fd1774b027c38fe6cafe0ede48d6ded2fb6873353f4e","observation_id":"48dee2ca-6eb2-4cb1-891f-2316976a350f","resolution":{"observed_at":"2026-08-07T13:31:09.126319Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:11.873280Z","title":"and Jordan, M","venue":null,"work_id":"89146fd0-e8af-45a1-b32a-54e0fff12ef3","year":2001},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:07.574967Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:d79ec49b8f899001ffa44d92d408a7d2f33d33c0ad055839afb047192fd76877","observation_id":"a165054a-c4b5-4304-8d85-034dc36c7266","resolution":{"observed_at":"2026-08-07T13:31:12.007109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:07.626448Z","title":"Controllable and compositional generation with latent-space energy-based models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:07.626448Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:640a6df3e614709755d899a326fa0301fdbe0b1a8c4e059b1e531cd1cb3dbe4e","observation_id":"71b669ca-faed-4d25-9359-d1031692547a","resolution":{"observed_at":"2026-08-07T13:31:07.626448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:07.689922Z","title":"Do imagenet classifiers generalize to imagenet? In International conference on machine learning, pp.\\ 5389--5400","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:07.689922Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:2196914c9b247c4588a3835995ba9e2ea20acde5ee5d8e3098518b5878b9cd3a","observation_id":"112f5f8a-5b3e-498d-b04b-1ab3e2b00769","resolution":{"observed_at":"2026-08-07T13:31:07.689922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:07.741988Z","title":"You only look once: Unified, real-time object detection","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:07.741988Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:919644a51468ce164e96cf5e60d3eb76773ab02349d602f3d7f03147a63ef747","observation_id":"d2b67b9c-9c00-43ba-8eec-937a791dee05","resolution":{"observed_at":"2026-08-07T13:31:07.741988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:11.615801Z","title":"High-resolution image synthesis with latent diffusion models, 2022","venue":null,"work_id":"a8a6b7a7-1afb-49ff-9e8b-d2a4c0d82a4f","year":2022},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:07.803399Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:3aceb1c8196548d2a97465e0d4fa217016c747bf81a715a050072224ab813a4c","observation_id":"ebbba95e-0e42-440a-a5f6-06980e5067cd","resolution":{"observed_at":"2026-08-07T13:31:11.710864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:07.888081Z","title":"U-net: Convolutional networks for biomedical image segmentation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:07.888081Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:882ef8f66337bf7c051eb0297cdf8d5c154e704b0a900fd17622b63587d523bf","observation_id":"78d6de68-f992-42a7-ab05-54765b74ffaf","resolution":{"observed_at":"2026-08-07T13:31:07.888081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.08221","last_updated":"2022-02-12T16:37:54Z","snapshot_observed_at":"2026-07-06T11:29:56.695924Z","submitted_at":"2021-07-17T11:24:18Z","title":"Visual Representation Learning Does Not Generalize Strongly Within the Same Domain","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.08221","snapshot_observed_at":"2026-08-07T13:31:07.991560Z","title":"u gelgen, J., Tr \\","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:07.991560Z"},"links":{"cited_paper":"/paper/2107.08221","citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:a0a5788ec8b59fc30920888b7ca94a7332f310dcb147fe590f4b2093da3825b2","observation_id":"b2ab825e-b8b8-41fb-af29-fe4dc072ed5f","resolution":{"observed_at":"2026-08-07T13:31:07.991560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14860","last_updated":"2023-03-06T23:19:17Z","snapshot_observed_at":"2026-08-06T15:09:47.073411Z","submitted_at":"2022-09-29T15:24:47Z","title":"Bridging the Gap to Real-World Object-Centric Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14860","snapshot_observed_at":"2026-08-07T13:31:08.053196Z","title":"Bridging the gap to real-world object-centric learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:08.053196Z"},"links":{"cited_paper":"/paper/2209.14860","citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:d5932251dbac8ed86694d15386bb82529a8d2d7d15ccca9fcb31d3dd8c0e3c36","observation_id":"570ebb4a-348e-4219-86d3-5af63f0b9598","resolution":{"observed_at":"2026-08-07T13:31:08.053196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:11.388958Z","title":"Detecting and recovering sequential deepfake manipulation","venue":null,"work_id":"2e14fb54-06d6-4ce1-8c17-5770003f1a9b","year":2022},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:08.110922Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:6a6ab27e4f03ccb0540373ad2f69d462910e450eb42b717c72de4911366ad1cc","observation_id":"cdd15997-d0ab-4205-aae2-454131f39351","resolution":{"observed_at":"2026-08-07T13:31:11.489486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:11.177029Z","title":null,"venue":null,"work_id":"821af218-b19f-4393-8883-e683035e622e","year":1971},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:08.167762Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:d11fb27da9dd08f881bc37f588ed0733bbf845ff78fb6526200bdd7fbfdef62f","observation_id":"a225580e-41e7-48e3-a005-c74272519bff","resolution":{"observed_at":"2026-08-07T13:31:11.281116Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:10.869728Z","title":null,"venue":null,"work_id":"65103fc4-6679-42e6-bdc9-42764c0c5f5e","year":2023},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:08.223743Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:beaeef07c6af809d0dd6f001fa5b62624e2fb067abf81ca33a04e68abe09a42e","observation_id":"1d09a0f6-7c6c-4159-a831-744b375b6a5f","resolution":{"observed_at":"2026-08-07T13:31:11.015827Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:08.303473Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:08.303473Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:46eb639711ea385a203caf84580220b0a968d473c78b04182af79d5bc06069cf","observation_id":"02f62b48-551d-4b34-a2b3-e31fcd5395f3","resolution":{"observed_at":"2026-08-07T13:31:08.303473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00763","last_updated":"2023-06-01T14:56:37Z","snapshot_observed_at":"2026-07-06T15:36:37.380930Z","submitted_at":"2023-06-01T14:56:37Z","title":"Learning Disentangled Prompts for Compositional Image Synthesis","version":1},"cited_work":{"arxiv_id":"2306.00763","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.00763","snapshot_observed_at":"2026-08-07T13:31:08.922246Z","title":"Learning Disentangled Prompts for Compositional Image Synthesis","venue":"cs.CV","work_id":"29129cff-50e4-45df-ac78-e3d733ef6858","year":2023},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:08.349745Z"},"links":{"cited_paper":"/paper/2306.00763","citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:48990acf14f698c4115cf5875255cffe084d157469f2b9281a549a701cb42fef","observation_id":"537cf5d5-9664-4d9f-89bf-06ff40278537","resolution":{"observed_at":"2026-08-07T13:31:08.952881Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19298","last_updated":"2024-06-27T16:13:34Z","snapshot_observed_at":"2026-07-06T18:38:00.379225Z","submitted_at":"2024-06-27T16:13:34Z","title":"Compositional Image Decomposition with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19298","snapshot_observed_at":"2026-08-07T13:31:08.420211Z","title":"B., and Du, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:08.420211Z"},"links":{"cited_paper":"/paper/2406.19298","citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:3353ec33b61c0c4837e4492fa3f320b1ef250187baea9a2a339fd8c103668fac","observation_id":"cc3b05f2-9e88-4570-8c8e-d40d0a6339d2","resolution":{"observed_at":"2026-08-07T13:31:08.420211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:10.630019Z","title":"Measuring robustness to natural distribution shifts in image classification","venue":null,"work_id":"0bf37baf-c7c8-45d7-a3fc-68179dfe2257","year":2020},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:08.476938Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:dcec09f1bcda684e232b96f664f85bc9e11e65638c8cf1a8be3f5fcd231bb1c0","observation_id":"1902976f-d1ee-439a-8839-1bccf6dbac17","resolution":{"observed_at":"2026-08-07T13:31:10.744729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:10.403682Z","title":"N., Vapnik, V., et al","venue":null,"work_id":"594f43ca-bc88-4d4c-bb4c-17fb6d2ba5e2","year":1998},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:08.550767Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:09c56370c7c0c36a2da85967d42171d43048829f2d7388629855794fbadd8dc0","observation_id":"5b0adc74-8031-4328-9138-d84c4b067ded","resolution":{"observed_at":"2026-08-07T13:31:10.502890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:10.113346Z","title":"Hierarchical open-vocabulary universal image segmentation","venue":null,"work_id":"6dbf6f38-3b68-4964-b322-d1c99f49d6a0","year":2024},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:08.596349Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:28894d5806ae8be8ed932e1997112923f36ca88c7fcc76159b1589762fa1c8b8","observation_id":"6e5b7ea1-67bb-466a-a552-fb0605d9379a","resolution":{"observed_at":"2026-08-07T13:31:10.241513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:09.882885Z","title":"Slot-vae: Object-centric scene generation with slot attention","venue":null,"work_id":"a8fd2729-cdd7-4b8e-bd0f-ad176304bb55","year":2023},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:08.634826Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:5405e088e0e5063008f57a09f20fd5ce6312784bb76d3eddf583d326e45433c2","observation_id":"1094d440-04a0-432f-b7b6-e5cde3c627fa","resolution":{"observed_at":"2026-08-07T13:31:10.002017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:09.687598Z","title":"Compositional generalization from first principles","venue":null,"work_id":"8a3ed7d1-00c1-44e5-b3e4-03a1ac16adbc","year":2023},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:08.661464Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:cb24292fd66c133c1748b239b1716125f189f5b0c5ccd01f14ff63f82af7d842","observation_id":"22082d0b-8a0d-49ee-833d-6ad0656f06ee","resolution":{"observed_at":"2026-08-07T13:31:09.788292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:31:08.719140Z","title":"Unleashing text-to-image diffusion models for visual perception","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:08.719140Z"},"links":{"citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:55306b1d4c9c34d6afa675d05480726f87f827b874d0b7621fffbc87b894de65","observation_id":"27473254-f210-4ec6-b326-c8a00f310769","resolution":{"observed_at":"2026-08-07T13:31:08.719140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12377","last_updated":"2024-04-18T17:58:03Z","snapshot_observed_at":"2026-08-02T11:29:41.147175Z","submitted_at":"2024-04-18T17:58:03Z","title":"RoboDreamer: Learning Compositional World Models for Robot Imagination","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12377","snapshot_observed_at":"2026-08-07T13:31:08.798977Z","title":"Robodreamer: Learning compositional world models for robot imagination","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling","version":4},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T13:31:08.798977Z"},"links":{"cited_paper":"/paper/2404.12377","citing_paper":"/paper/2505.21780"},"observation_digest":"sha256:70921af79525ce8c0216c95a654cc53ce8a6af05b1a9b68a3f5c803bf67a8cb7","observation_id":"4df0415b-4810-4649-bf9e-c8f931a56890","resolution":{"observed_at":"2026-08-07T13:31:08.798977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.21780","last_updated":"2025-06-23T19:26:04Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T04:20:47.155726Z","submitted_at":"2025-05-27T21:25:11Z","title":"Compositional Scene Understanding through Inverse Generative Modeling"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":3,"verified_fuzzy":23},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 1 inbound Pith citation observation for arXiv:2505.21780."}