{"as_of":"2026-08-10T05:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:556df0c4ad0049d9e153fc70efe693d53c16ec6ca063d6d2b2c693e9b6995c45","coverage":[{"denominator":73,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":73,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T13:16:44.217929Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.20855/citation-record","integrity":"/paper/2507.20855/integrity","json":"/paper/2507.20855/citation-record.json","paper":"/paper/2507.20855"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.806071Z","title":"Slamp: Stochastic latent appearance and motion pre- diction","venue":null,"work_id":"01634a1e-b64f-4614-908c-b1df276e333e","year":2021},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:42.664655Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:40446fa726df6f3d5eb086be46397b6555f346200eda50de5b3756c07cd3287e","observation_id":"4a53892a-e5ca-4463-a595-7d52443aef09","resolution":{"observed_at":"2026-08-06T13:16:44.808932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.797912Z","title":"Stretchbev: Stretching future instance prediction spatially and temporally","venue":null,"work_id":"d893bed3-2a8c-4e12-baea-bd0ce1aef4a3","year":2022},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:42.726015Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:15b6fe0f6037ad9021d7727d600a21fdf8fd9e9f065854b7e8c79fb21ec26ea3","observation_id":"eb8ca687-a7ee-4de6-87da-0115022032ca","resolution":{"observed_at":"2026-08-06T13:16:44.800561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.789344Z","title":"Slot-guided adaptation of pre-trained diffusion models for object-centric learning and compositional generation","venue":null,"work_id":"40254d3f-fdfc-43e4-a266-22b17ab7e31e","year":2025},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:42.800382Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:6a9491b88d0dcdb25b9d4b63952560eac189ea217552ced92fe16d5c941c1529","observation_id":"1d62f899-9ec3-4a13-b283-b9a7c11f328d","resolution":{"observed_at":"2026-08-06T13:16:44.792481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.781347Z","title":"Self- supervised Object-centric Learning for Videos","venue":null,"work_id":"24169ac2-1481-4cc2-ad3b-81a4def98784","year":2023},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:42.882950Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:9f37786a2dc6c299aaf77583ba226efcc814fd21c2e2b1378e64d5fca82926db","observation_id":"b98a97f7-cbe1-49a6-a34e-55b60c85acfd","resolution":{"observed_at":"2026-08-06T13:16:44.784142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.773208Z","title":"Systematic generalization: What is required and can it be learned? In Proc","venue":null,"work_id":"b8e26c91-a502-48bc-b7d3-a4065fdae064","year":2019},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:42.996989Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:5976d83a6e37481df8be20b83789ef912145969e9bb5cf29f367de917b4b7312","observation_id":"fa7374ae-00d6-49ec-bd27-1016364b0d8b","resolution":{"observed_at":"2026-08-06T13:16:44.776126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.765361Z","title":"Object discovery from motion- guided tokens","venue":null,"work_id":"94fe037d-1f3c-4dea-a3e3-06708d00c7ed","year":2023},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:43.070604Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:222e20f11dd0678c4072c740daf9c1609f627d9ecded4bdd3a5d5e8ec82aea90","observation_id":"95eb09a6-88ba-4d1d-b393-f1c94fef3206","resolution":{"observed_at":"2026-08-06T13:16:44.768077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:43.142294Z","title":"Lumiere: A space-time diffusion model for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:43.142294Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:14afbc3ff84de37800d6be9e8f3da9ab8c754c16fe73923d93d5a74ad621c580","observation_id":"7533f941-d8d2-41d5-915f-96c2da1f9353","resolution":{"observed_at":"2026-08-06T13:16:43.142294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.752244Z","title":"Invariant slot attention: Object discovery with slot-centric reference frames","venue":null,"work_id":"bde7b805-f1ad-4c6b-815b-822086e9440f","year":2023},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:43.213561Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:da1d5a0838b4c52a482d9713db8600188777b6fb3c08737a1808826a0df07301","observation_id":"904ad9e4-e0ac-4776-8d6f-6d8f52199e08","resolution":{"observed_at":"2026-08-06T13:16:44.754950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.744914Z","title":"Align your latents: High-resolution video synthesis with latent diffusion models","venue":null,"work_id":"3d946f46-20d8-4280-b21f-fbc7f723ba03","year":2023},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:43.244544Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:12b38669368a1f5ff328e92dc096a738552c6d01c829212e1a2ae061916ef701","observation_id":"564176c5-8881-49e7-bf47-90de864fcdac","resolution":{"observed_at":"2026-08-06T13:16:44.747508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.737460Z","title":"Emerging properties in self-supervised vision transformers","venue":null,"work_id":"35b77abe-9dba-403d-8306-d4ee2ba0c037","year":2021},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:43.317792Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:7d81e474aeeb1f65dc7802de80f99bf0387d6712bcc68cdc9c45691feb10b54c","observation_id":"7a2ab687-3873-4bdf-a200-01ed3cfdfe65","resolution":{"observed_at":"2026-08-06T13:16:44.740093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.729978Z","title":"Pixart-α: Fast training of diffusion trans- former for photorealistic text-to-image synthesis","venue":null,"work_id":"ece29162-aa19-41c4-8ded-7beea34907a7","year":2024},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:43.429828Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:882c79bb83609b3751a88c240666afaff257c95119fc1b1030755700d82f28dd","observation_id":"707f5e7d-a837-45ad-96ec-57af4f0a52be","resolution":{"observed_at":"2026-08-06T13:16:44.732572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.722462Z","title":"Vision transformers need registers","venue":null,"work_id":"bba5b707-13af-4a0b-a67a-55bf85e2886e","year":2024},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:43.547864Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:5e5666c8bd8ed43bdc62811bd4eb2bcc55b5a2bb16c50f5c0895413160fdb00e","observation_id":"59be87bd-7ec8-4363-b3bc-ad85fe3548b2","resolution":{"observed_at":"2026-08-06T13:16:44.725128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.714971Z","title":"Diffusion models beat GANs on image synthesis","venue":null,"work_id":"25a52dcd-769c-4408-9ede-f45b219a6461","year":2021},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:43.664202Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:c74435c7f96214353ca5c3670939981e2c94890a33a188c6e3b6a5aaef2911f0","observation_id":"9d9630db-6022-4695-9b67-8a9adce56d21","resolution":{"observed_at":"2026-08-06T13:16:44.717663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.707405Z","title":"Betrayed by attention: A simple yet ef- fective approach for self-supervised video object segmenta- tion","venue":null,"work_id":"6132e3ef-fccf-47d0-ada3-b0bd92d20319","year":2024},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:43.782017Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:2c527d42376793e24c07eaae8f6405ecfd56f498826ac27fd88a34c17511f4a3","observation_id":"8c2f57a6-5277-4fe7-93d7-3b620ce15ed6","resolution":{"observed_at":"2026-08-06T13:16:44.710132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.699692Z","title":"SAVi++: Towards end-to-end object-centric learning from real-world videos","venue":null,"work_id":"f7a580cd-7567-4873-96fc-79388c62a504","year":2022},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:43.921894Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:f6ea12b89cfb807a198c1c33f7684f6fc2005d633ccd0ff2a7662aaaeadd562c","observation_id":"74e803c0-7c62-43c1-b6b8-4245ad24607d","resolution":{"observed_at":"2026-08-06T13:16:44.702365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.691960Z","title":"Attend, infer, re- peat: Fast scene understanding with generative models","venue":null,"work_id":"634010cb-8182-46b2-a305-65710dc2e05e","year":2016},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:43.928307Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:325ddb1e9fe4142a93d1ac67226d08ce284a30fee90d314c826bab1f6ba6e8eb","observation_id":"5f54637c-c83b-4f9a-901e-cc3a1f26adbf","resolution":{"observed_at":"2026-08-06T13:16:44.694512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.684638Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":"3751497c-76f2-4f5b-b58d-f094d4298fe3","year":2024},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.034897Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:574af958a17dc69956ae0e26b5cdfe49cfb87b6a51e28f331ff89074e00f7eff","observation_id":"29f9374a-5e7b-447c-a0ca-b79e2474428c","resolution":{"observed_at":"2026-08-06T13:16:44.687199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.677170Z","title":"The PASCAL visual object classes (VOC) challenge","venue":null,"work_id":"2e85f881-97f1-4073-83b1-e96fe5236b4e","year":2010},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.050887Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:33bfd9ef554c9e8619248d160ae067548610fd56af8846fa2a35adfce89a8df7","observation_id":"e848e0dd-2fde-4e9c-9db3-7ee48f205314","resolution":{"observed_at":"2026-08-06T13:16:44.679727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.669481Z","title":"Connectionism and cognitive architecture: A critical analysis","venue":null,"work_id":"29a33b34-7130-416b-bb80-9cb097c1cf16","year":1988},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.057618Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:3592f2afadc3d563df6423ecec02a552f40508ea1909d336c51185f17a3de16b","observation_id":"2c509ebe-7e2b-4dbc-ad6d-22c102cae5ff","resolution":{"observed_at":"2026-08-06T13:16:44.672196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.661778Z","title":"Understanding the diffi- culty of training deep feedforward neural networks","venue":null,"work_id":"75ca5a0f-a7d4-4e24-ada7-53a94ec07270","year":2010},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.085924Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:369bb9bc39d1577ddf983c66f9d2a61b85aebe04ceedfde238e7edec41cb6907","observation_id":"534e61bc-8442-41ee-9984-7d04bdbb1073","resolution":{"observed_at":"2026-08-06T13:16:44.664636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.654102Z","title":"Multi-object representation learning with iterative variational inference","venue":null,"work_id":"1ff389f1-57c2-4b79-8014-482e2ead95a0","year":2020},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.088511Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:b7be03e3da258957d8ab6bf5b44aa4201f856de83561eacddf0e205967a06c99","observation_id":"77e30ea2-d3d8-4895-a2cf-b9afd15ebbfc","resolution":{"observed_at":"2026-08-06T13:16:44.656961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.05208","last_updated":"2020-12-09T18:02:49Z","snapshot_observed_at":"2026-08-07T12:34:15.648511Z","submitted_at":"2020-12-09T18:02:49Z","title":"On the Binding Problem in Artificial Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.05208","snapshot_observed_at":"2026-08-06T13:16:44.091002Z","title":"On the binding problem in artificial neural networks","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.091002Z"},"links":{"cited_paper":"/paper/2012.05208","citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:832b14057c7da437d4e0421f11821c1a0cb0dadef8810db9c7127c90fd053574","observation_id":"58c9c3fa-53e4-411f-a45c-a0f2267e8589","resolution":{"observed_at":"2026-08-06T13:16:44.091002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.646224Z","title":"Gans trained by a two time-scale update rule converge to a local nash equi- librium","venue":null,"work_id":"0f330704-9d2a-4cb6-8974-e59ceec0c9f2","year":2017},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.093688Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:cc6bb348973d2b6447165a1fcd12dd317a5eabc164cad2de2702a469bddcc395","observation_id":"1477d4d0-274e-45d9-b34f-952f1459db35","resolution":{"observed_at":"2026-08-06T13:16:44.648983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.638639Z","title":"Denoising diffu- sion probabilistic models","venue":null,"work_id":"09598ce8-b464-4de3-8e20-d0b7f0a7f468","year":2020},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.096080Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:c37d199b288729d68f69332f2ca546dc7ccd339b359c506e9b015ebf59632b60","observation_id":"7d369d06-fc9f-4b2d-a042-6b0553d869a1","resolution":{"observed_at":"2026-08-06T13:16:44.641276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-06T13:16:44.098463Z","title":"Imagen video: High definition video generation with diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.098463Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:ed3355f72c3477714c1c72dff50df54eb29ae15ea2ab037cf8f25aaa833a01c8","observation_id":"8f00cd9d-d67b-4eee-9010-f96cbbebff78","resolution":{"observed_at":"2026-08-06T13:16:44.098463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.630554Z","title":"Video dif- fusion models","venue":null,"work_id":"fc3fdf23-20d7-417f-9b6c-0084f0c2a5b8","year":2022},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.101111Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:119c72f89a9f720811d1005935283c8c60c5f51aeaca9c603ea9ba3e90794a23","observation_id":"0b8f085c-cbb8-4239-b402-210cb3196108","resolution":{"observed_at":"2026-08-06T13:16:44.633260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.622834Z","title":"Object-centric slot diffusion","venue":null,"work_id":"b7cafb2f-dd71-4cef-ac47-91b75adfaa34","year":2023},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.103608Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:4cbbb6deee8efd0647fb87689230833c6cad07b62011b9a52d759b7a3cc129d4","observation_id":"e8569ae3-5caf-4512-a0f6-1878af20ae95","resolution":{"observed_at":"2026-08-06T13:16:44.625355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.614585Z","title":"CLEVR: A diagnostic dataset for compositional language and elementary visual reasoning","venue":null,"work_id":"66f0f2a4-6489-4914-9d72-922267cf8dfd","year":2017},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.106047Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:54e1f14033ae4f6ecdc164e4e91d5d26147b9cccfa4d5b827f66d0d55df8f1f9","observation_id":"27f4d3f3-0c29-4eb7-b51f-4772803cad9c","resolution":{"observed_at":"2026-08-06T13:16:44.617467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.606278Z","title":"ClevrTex: A Texture-Rich Benchmark for Unsupervised Multi-Object Segmentation","venue":null,"work_id":"9711b9fc-011d-4c61-88d9-108a3520c5ed","year":2021},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.108500Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:cdeb70a4f6cca668067736ec1d243ac3957d5472bda6a744a62f9dfaefc6dc4e","observation_id":"77265028-906b-4e4e-aba8-e68f208e99f6","resolution":{"observed_at":"2026-08-06T13:16:44.609002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.597933Z","title":"Con- ditional object-centric learning from video","venue":null,"work_id":"c7baf76a-4e03-40cb-885b-074031c5167c","year":2022},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.111133Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:af404b0370a7f33b1f314ead440e9300eea3855ae46397c6e049db3d2fbb1708","observation_id":"1ed7a1e7-71f1-4bc6-815d-02ac1b9c81a6","resolution":{"observed_at":"2026-08-06T13:16:44.600628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.589515Z","title":"Sequential attend, infer, repeat: Generative mod- elling of moving objects","venue":null,"work_id":"795c0ce6-cda2-4484-979b-066d562659de","year":2018},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.113684Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:580b8cccbb5fffe157cebd53c7c1cfa2bc958e793d0381593f3178f6d8c330db","observation_id":"30f913bd-9f30-4e1b-a0dc-deaa3d39e6d0","resolution":{"observed_at":"2026-08-06T13:16:44.592327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.581320Z","title":"Structured object-aware physics prediction for video modeling and planning","venue":null,"work_id":"5c847602-00ab-4b4b-a70b-ecb4ca30a0e1","year":2019},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.116118Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:eda3386ebea3ff5fc5e4b4df596ac140754998c6bba1626be8076dd7e4df489a","observation_id":"17a89202-5cc8-4743-b9af-57f04207f6ea","resolution":{"observed_at":"2026-08-06T13:16:44.584228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.572668Z","title":"Hierarchical compact clustering attention (coca) for unsupervised object-centric learning","venue":null,"work_id":"290e9c2f-7c6e-4175-afd3-578041b093fb","year":2025},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.118397Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:4254c0e68e0ea3c1e719fafce54bf016c295a4151eec085af6a45b84a2c3353a","observation_id":"e6fb7c66-938a-4e30-912d-14fc1de3b904","resolution":{"observed_at":"2026-08-06T13:16:44.575661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.120650Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.120650Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:9b7c425e457967534c46a349f92a5d3cb67036818ed64ebcbb01647cf384fc1a","observation_id":"5ddaa5c3-53a9-47ec-b5bc-1618ee2143fb","resolution":{"observed_at":"2026-08-06T13:16:44.120650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.559537Z","title":"Building machines that learn and think like people","venue":null,"work_id":"cb000d49-d853-44a2-aa8e-35172b047314","year":2017},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.123075Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:b8f1c4de01504e374527df4344558504cfa16de513d3d569dfc2d60454c54c2b","observation_id":"834353d7-8e1f-4680-a4b7-7da091f144c5","resolution":{"observed_at":"2026-08-06T13:16:44.562155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.552028Z","title":null,"venue":null,"work_id":"14c83c50-9bb4-493d-987f-a6c3b76738b5","year":2013},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.125394Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:99944bf31d9471223e00509b62b6aacd221df7ed2dfa2f827ddca782ff739e5d","observation_id":"0d7f7806-0acb-42db-a5c5-f5a61b987d54","resolution":{"observed_at":"2026-08-06T13:16:44.554659Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.544461Z","title":"Microsoft COCO: Common objects in context","venue":null,"work_id":"2068088a-21a4-4a75-a8fa-5fdf07793038","year":2014},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.127855Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:3d97f4ceda8a8a03277abe27f49a1f8fbdd25670e23642e196e1b844426a5cb3","observation_id":"eba8958f-3f05-401b-a4ab-d739601f684b","resolution":{"observed_at":"2026-08-06T13:16:44.547077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.536129Z","title":"Improving generative imagination in object-centric world models","venue":null,"work_id":"6bda5a2b-885d-4482-bdbc-eb8bd2025549","year":2020},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.130351Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:8d000168ab1d3c87b713f086ab629006c41ffee858ed12743e3e9d182ce06030","observation_id":"3545ae88-31fd-481a-8f73-0a4d3a4493e6","resolution":{"observed_at":"2026-08-06T13:16:44.539180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.528656Z","title":"Object- centric learning with slot attention","venue":null,"work_id":"731dc54b-0fb5-4929-b908-10ac3d60aaf5","year":2020},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.132668Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:8cfa66eb89a827417348a3c33abc56d509f758a50e033de6f23aa2e5ffe5250a","observation_id":"0e3c82ae-6228-47e3-9f6e-e060c820ef0a","resolution":{"observed_at":"2026-08-06T13:16:44.531327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.520894Z","title":"Decoupled weight decay regularization","venue":null,"work_id":"88ab2495-71aa-4327-99ea-c35665e01ebe","year":2019},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.135327Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:f97bc4d188c964865f9a3b0cfd5827a4a490a19af9d6749acd74277125787c05","observation_id":"32da4fa8-bedc-423f-8fe7-39cb16b2ee4e","resolution":{"observed_at":"2026-08-06T13:16:44.523772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.512803Z","title":"Temporally consistent object-centric learning by contrasting slots","venue":null,"work_id":"ac90cc44-4d6a-4e46-830e-2df020574e04","year":2025},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.138069Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:c35c02300436f749b6b2b4f7082cf4f54454f18f9d6a77c49e3f3b651f5fb4ed","observation_id":"5adc5170-5997-46c5-9570-514199a6fa17","resolution":{"observed_at":"2026-08-06T13:16:44.515469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.504556Z","title":"T2i-adapter: Learning adapters to dig out more controllable ability for text-to- image diffusion models","venue":null,"work_id":"f3ea8cd6-d090-4cd9-9d3f-c38c4baae168","year":2024},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.140512Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:355ddbd49ac49aef8695a0e27a8494c18cbe9fd2ae2d9a9d411f4fcb874855f6","observation_id":"2fc8e8f7-388a-47d0-a9ff-cdd64dffacbf","resolution":{"observed_at":"2026-08-06T13:16:44.507184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.497099Z","title":"Segmentation of moving objects by long term video analysis","venue":null,"work_id":"116c2647-c736-467a-a332-1ca5a2f4bcf3","year":2013},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.142834Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:e7d082e5edb101d671a63ab791bd7e66973aa394075fe3467046210bd3e37c80","observation_id":"00dd651f-33cd-41ae-b79d-05ca2e1c01a3","resolution":{"observed_at":"2026-08-06T13:16:44.499643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.489203Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":"604e95e6-5ad8-4294-8419-f107c0332018","year":2023},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.145544Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:82527f1e8424d393450147f4a29005add5703c8611f80f66997d34f0fa6b0e6d","observation_id":"7f7c8fda-9ce4-40af-8397-092a650ea45d","resolution":{"observed_at":"2026-08-06T13:16:44.491763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.481652Z","title":"A benchmark dataset and evaluation methodology for video object segmentation","venue":null,"work_id":"214a9a9a-8e62-4857-b3b6-1ff5a7feeb17","year":2016},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.148072Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:f298c1e916a01fa1a80d1e93bb4a62f25120a05e549dd40ede6b840d7ab8a507","observation_id":"24f67be7-53c4-4945-9708-08e717ecb150","resolution":{"observed_at":"2026-08-06T13:16:44.484295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.473738Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":"3ef60613-5149-4257-ae6d-a3b6806bb11d","year":2024},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.150674Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:51774793c81a7c0b7a9968f4d373a687931cd0fd447a03230365c9ee2b6e973d","observation_id":"a7e07070-f2f3-4527-867b-36a12b29eaf6","resolution":{"observed_at":"2026-08-06T13:16:44.476532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.466165Z","title":"Rethinking image-to-video adaptation: An object-centric perspective","venue":null,"work_id":"25cc5d88-a6bf-4ef3-91d5-240029f9e620","year":2024},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.153056Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:854fe1cfab2549a8a658ecc2e8a28a9d7825f98b8ca5dc49403b9b3d440496f2","observation_id":"19ade172-0b41-4ab7-91ad-6c6fd7a0acf7","resolution":{"observed_at":"2026-08-06T13:16:44.468916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.458572Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"6ebbc4a7-fb77-417f-90f3-7bdee61fb79d","year":2021},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.155324Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:6274212d06237c6daaf4d6a1b2da2b843d1c51143b8dccca2ccf448cc59debad","observation_id":"701887ea-ba26-49eb-8e74-852cdb8f9523","resolution":{"observed_at":"2026-08-06T13:16:44.461242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-06T13:16:44.157831Z","title":"Hierarchical text-conditional image generation with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.157831Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:f99d19511bdb5ff2a28d4907f624e106d621f6167bed24a04b545cfe44cdd9d7","observation_id":"9b7f2095-64c9-4937-bfd2-2b70c1e364d3","resolution":{"observed_at":"2026-08-06T13:16:44.157831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.450643Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"4950fd78-35e4-48a8-b1bb-3b602589d34a","year":2022},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.160495Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:52d7ad0666434f9f42d0e3934dbf56a409a03b699b808facbb770e7e0ddd847a","observation_id":"21d5838a-89ce-4f63-b000-97a33195b8a6","resolution":{"observed_at":"2026-08-06T13:16:44.453298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.442239Z","title":"Photorealistic text-to-image JOURNAL OF LATEX CLASS FILES, VOL","venue":null,"work_id":"07407a22-5eb8-4000-8afa-936faf5b59a5","year":2020},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.162837Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:b9a14ab3cb55e62d49b1d71bc494703c002830a31b4ff7710189e40fce10f8e5","observation_id":"73df8951-2164-4f06-ac6b-f976ac6425ea","resolution":{"observed_at":"2026-08-06T13:16:44.444819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.434968Z","title":"Toward causal representation learning","venue":null,"work_id":"19b6cc69-026e-44b1-9ce2-862ddf61e928","year":2021},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.165116Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:1ee67d25a3515ae104e1bd022fcda9bfaccb1917519320d45bdeb042f6287fc6","observation_id":"c56b3bf3-90b6-4d05-b79c-9b3d626a4569","resolution":{"observed_at":"2026-08-06T13:16:44.437460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.427204Z","title":"Bridging the gap to real-world object-centric learning","venue":null,"work_id":"af179aed-2f99-4495-b895-bcf1a7748883","year":2023},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.167520Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:0274e556cb2da4d113d2ca18ce7e1ecaac45fdd15d12dc30311426af51b69e90","observation_id":"79c76354-ae9d-4e40-8cb6-4c0501799db6","resolution":{"observed_at":"2026-08-06T13:16:44.430034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.418979Z","title":"Make-a-video: Text-to-video generation without text-video data","venue":null,"work_id":"27f0142c-6031-435d-9342-9ec6d638e99f","year":2023},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.169814Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:d48ab3df4a8909fb7a27becca291d1c84e4e6c928e43659a8c607ba2eeab98ee","observation_id":"3ab10f8a-824f-47d9-91f1-a7c1d2ab0205","resolution":{"observed_at":"2026-08-06T13:16:44.422188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.411363Z","title":"Illiterate dall- e learns to compose","venue":null,"work_id":"3cf7e472-194a-4577-aa9c-f3595d5d7a4b","year":2021},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.172171Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:fb67d93c5f0e41b19842351124c9c7e344b2dfe8365cd995239392aefd98c122","observation_id":"8a7ca348-9b49-46d5-8aa7-70c0098f49b6","resolution":{"observed_at":"2026-08-06T13:16:44.414080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.403416Z","title":"Simple unsu- pervised object-centric learning for complex and natural- istic videos","venue":null,"work_id":"4e6331e2-a1c9-479b-843d-82874d4f6fa1","year":2022},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.175236Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:fb31afdb904b121722ef4548dd7e1262cc790fec30fdcb6ed5e33f0f690b84cd","observation_id":"9d97a6e9-7422-43a5-8a2c-5a424caf13f7","resolution":{"observed_at":"2026-08-06T13:16:44.406073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.395803Z","title":"Guided latent slot diffusion for object-centric learning","venue":null,"work_id":"7ccaddea-7124-4c62-8545-5b7e407e6b37","year":2025},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.177916Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:62449818b53268d604eb8685cd861736c7b3bc4e009757d2dcca673b59ab820d","observation_id":"425ccc73-ca74-4252-bcb6-d1e1c1ad69e4","resolution":{"observed_at":"2026-08-06T13:16:44.398611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.387436Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":"de01a5c1-8173-4594-8854-5906fd86fc28","year":2015},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.180311Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:7f623ee7e988e6dfb9bddd477ed0a9a7da404b980a4b7d70a377df124cb53ef3","observation_id":"7ac35c2b-f2d0-487e-bede-3d8421ad2798","resolution":{"observed_at":"2026-08-06T13:16:44.390287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.379814Z","title":"Core knowl- edge","venue":null,"work_id":"20f488dd-391e-4c98-b5dc-c6b28532f9b3","year":2007},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.182654Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:13037403ce9465c74c4f0a9052d84279090387b261f104044b3767334b0a0b74","observation_id":"bd9ce06d-2791-4be4-8d9d-68151011e5e9","resolution":{"observed_at":"2026-08-06T13:16:44.382246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.372496Z","title":"Mind games: Game engines as an architecture for intuitive physics","venue":null,"work_id":"d9158e73-69e3-43b8-8ce2-e806d3e6fe27","year":2017},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.185445Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:ed00e259180f705699c24469f07a5e5548c0d7081250ae6108e6e3b9e3c2f355","observation_id":"b0fbe04d-6cdf-42a2-a350-706fcfb4e2c0","resolution":{"observed_at":"2026-08-06T13:16:44.375066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-07-06T07:19:11.957225Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-06T13:16:44.188237Z","title":"To- wards accurate generative models of video: A new metric & challenges","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.188237Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:b2b9ec6006495c9bf59bfdadddf2e68a06b2834aafef44feb87aa06bac41db9d","observation_id":"af1b4f84-5a23-4632-aedb-2b80edaab6a8","resolution":{"observed_at":"2026-08-06T13:16:44.188237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.365150Z","title":"Attention is all you need","venue":null,"work_id":"295b368b-9ec1-4e8a-bf33-381ec5db4a39","year":2017},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.191030Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:ae0cac51df8a46da241bfbcbde2f2580a2d66ddb1bad72ce056532b21dcd6107","observation_id":"823ef0a0-2908-4923-874a-54a70b1d1b13","resolution":{"observed_at":"2026-08-06T13:16:44.367744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.357335Z","title":"Phenaki: Variable length video generation from open domain textual descrip- tions","venue":null,"work_id":"2ca7469a-d095-4d1b-8797-40286c44b63c","year":2023},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.193315Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:af0e9e0fe36b388fdc5026fe3d731d0bab2df218c54f22a135a28ad06ccce10b","observation_id":"47df23b6-9d0d-4d93-b779-f07af27600c2","resolution":{"observed_at":"2026-08-06T13:16:44.360071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.349428Z","title":"Videocomposer: Compositional video syn- thesis with motion controllability","venue":null,"work_id":"8dd416ec-a62b-40d7-97e9-923de371df20","year":2023},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.195673Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:234582969766969b164436778e0900d99487b8ad9352c77846c85d42d2256f26","observation_id":"df72c4e7-c5a8-41bf-b7c3-552be28f8323","resolution":{"observed_at":"2026-08-06T13:16:44.352046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.341663Z","title":"Bovik, Hamid R","venue":null,"work_id":"57004741-6853-43d1-9c30-40072a4a90be","year":2004},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.198465Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:554f97ea4c0809e1f0d82c1eaa6811544be9bcfde12d69e0d1c380b4c579cc96","observation_id":"edcc823e-9d61-4eba-8783-04ba52c8c529","resolution":{"observed_at":"2026-08-06T13:16:44.344281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.333703Z","title":"Tune-a-video: One-shot tun- ing of image diffusion models for text-to-video generation","venue":null,"work_id":"410cb5db-8682-4b98-b871-c64dcf38c1ef","year":2023},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.200811Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:71131fb1d3c68bd6eaa2aebc1f6d89011855be2ae15252ea9cfe576483c562c3","observation_id":"ee08bb91-16ae-485c-939d-fdc14c5731c6","resolution":{"observed_at":"2026-08-06T13:16:44.336566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.325964Z","title":"SlotFormer: Unsupervised visual dynamics simulation with object-centric models","venue":null,"work_id":"d36fca9b-0ecb-461c-9179-7f30ddbdc0bc","year":2023},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.203102Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:7b8e8aff89ec51823619dcb4b0d43bb332a9a14775f254fbcdafa64d1cd079ad","observation_id":"430bb969-8803-40e6-b8c4-8ed33041241e","resolution":{"observed_at":"2026-08-06T13:16:44.328676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.316950Z","title":"Slotdiffusion: Object-centric generative model- ing with diffusion models","venue":null,"work_id":"2abd2293-4a1d-411d-a386-549cad221b60","year":2023},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.205454Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:67084117f6922540ced560e806afa90fe01bc591628bec6af14ef05073a62afa","observation_id":"e0d99ffa-f4c9-4e52-b5e7-f53cfec49e3b","resolution":{"observed_at":"2026-08-06T13:16:44.319819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.308763Z","title":"Segment- ing moving objects via an object-centric layered represen- tation","venue":null,"work_id":"282426d8-592d-4be9-a3ef-03406f494d90","year":2022},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.208326Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:9c7a1a7e5f6b3cbcd645ff6995b1107f3e3ae9bdfdbf3b0a7355e4bd421afd7a","observation_id":"049bc11e-77fc-4b40-946f-fe0b3b0f08ef","resolution":{"observed_at":"2026-08-06T13:16:44.311397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.300599Z","title":"Youtube-vos: A large-scale video object segmentation benchmark","venue":null,"work_id":"75709842-5514-46a7-8e1b-5c20a203db2a","year":2018},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.210743Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:38d80844ea7550ba6ac66f08b2d67e12975fe531cbbd09112b167a4836c1eb9c","observation_id":"ab3234e6-fe68-4713-a9ce-81bc16a5decc","resolution":{"observed_at":"2026-08-06T13:16:44.303372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.292706Z","title":"Video instance segmentation","venue":null,"work_id":"9f7d487a-cb24-494d-be64-fcaf849f75de","year":2019},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.213086Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:8400fcfaa886153a653609ea77b3e5ee5a20a0a1689076435bf284bc6485b65d","observation_id":"94a6aae8-6199-45ce-943e-2c72a445de2b","resolution":{"observed_at":"2026-08-06T13:16:44.295284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.284721Z","title":"Efros, Eli Shechtman, and Oliver Wang","venue":null,"work_id":"0cc87bc4-a366-4a4d-9512-b89697d6c21e","year":2018},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.215584Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:c90f71d60577c5313654f9f7d511b4ce7f30925bf2f55c8cf8c7c2b09482fb6b","observation_id":"53ca6954-638a-4aff-90f2-0f387802af24","resolution":{"observed_at":"2026-08-06T13:16:44.287579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:16:44.274395Z","title":"Controlvideo: Training-free controllable text-to-video generation","venue":null,"work_id":"b08fe634-722c-41cb-baf0-72e45a67ac61","year":2024},"citing_paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T13:16:44.217929Z"},"links":{"citing_paper":"/paper/2507.20855"},"observation_digest":"sha256:a0976a88c2e125fdd11d8369478bca332749f10f8626383de38cbb9a4645b778","observation_id":"cdae38e8-f316-438b-ab0c-21b77609e9d0","resolution":{"observed_at":"2026-08-06T13:16:44.278578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.20855","last_updated":"2025-07-28T14:11:04Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T11:51:11.237091Z","submitted_at":"2025-07-28T14:11:04Z","title":"Compositional Video Synthesis by Temporal Object-Centric Learning"},"reference_resolution":{"displayed":73,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":0,"verified_fuzzy":66},"total_outbound_references":73},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 73 of 73 outbound references and 0 inbound Pith citation observations for arXiv:2507.20855."}