{"as_of":"2026-08-13T21:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a0b46cca3da7c0e0dc61171d513ee6cc6f36cdda29e1293879f8ab7573612ea5","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T20:45:00.558941Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.08376/citation-record","integrity":"/paper/2509.08376/integrity","json":"/paper/2509.08376/citation-record.json","paper":"/paper/2509.08376"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:45:01.235614Z","title":"Emergence of in- variance and disentanglement in deep representations.The Journal of Machine Learning Research, 19(1):1947–1980,","venue":null,"work_id":"a28403c6-7c62-4425-b43e-b3588ac944a1","year":1947},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T20:44:59.710879Z"},"links":{"citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:28b67a585ed6dcd20ae2b236c9df8eec0806be5c45fc767717aae7abef2bf1cb","observation_id":"b3d2fe4b-137e-4cad-b2e4-86a519fa0b96","resolution":{"observed_at":"2026-08-04T20:45:01.238598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.00496","last_updated":"2018-10-28T14:29:46Z","snapshot_observed_at":"2026-07-06T06:58:51.877372Z","submitted_at":"2018-09-03T08:38:34Z","title":"LRS3-TED: a large-scale dataset for visual speech recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.00496","snapshot_observed_at":"2026-08-04T20:44:59.780638Z","title":"Lrs3-ted: a large-scale dataset for visual speech recog- nition.arXiv preprint arXiv:1809.00496, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T20:44:59.780638Z"},"links":{"cited_paper":"/paper/1809.00496","citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:dfd230f396152d7ac8b1e0dc7c791dc5004226a0ab849e9f884ea0cb07e57302","observation_id":"339c0bf8-6745-4aac-82de-512cda9eeb5b","resolution":{"observed_at":"2026-08-04T20:44:59.780638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1612.00410","last_updated":"2019-10-23T22:47:44Z","snapshot_observed_at":"2026-07-06T05:21:01.935928Z","submitted_at":"2016-12-01T20:12:40Z","title":"Deep Variational Information Bottleneck","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.00410","snapshot_observed_at":"2026-08-04T20:44:59.818605Z","title":"Deep variational information bottleneck.arXiv preprint arXiv:1612.00410, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T20:44:59.818605Z"},"links":{"cited_paper":"/paper/1612.00410","citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:f9b165bf48027c3dc1491bb811b698060e0bcad4a02e45a52b56d75a1b6b758f","observation_id":"176ac107-65d7-4870-88f5-82a4ff7d9531","resolution":{"observed_at":"2026-08-04T20:44:59.818605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.05453","last_updated":"2020-02-16T18:35:27Z","snapshot_observed_at":"2026-08-11T05:38:01.369830Z","submitted_at":"2019-10-12T00:55:06Z","title":"vq-wav2vec: Self-Supervised Learning of Discrete Speech Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.05453","snapshot_observed_at":"2026-08-04T20:44:59.929335Z","title":"vq- wav2vec: Self-supervised learning of discrete speech repre- sentations.arXiv preprint arXiv:1910.05453, 2019","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T20:44:59.929335Z"},"links":{"cited_paper":"/paper/1910.05453","citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:eeddcb0b860a0d78d39c29ec74cbd565c8a6b555a455c75373d3acaad1c6ffd5","observation_id":"f358c909-a9a3-40c7-8130-9d129917742f","resolution":{"observed_at":"2026-08-04T20:44:59.929335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:45:01.226728Z","title":"Con- trastively disentangled sequential variational autoencoder","venue":null,"work_id":"d2f6c8fb-233e-40c3-a944-0a29e15c09ad","year":2021},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.002204Z"},"links":{"citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:5ce420a67497536e19b87f101e0c494690ee83b504ed34022b92b2e9e76e3d04","observation_id":"c8754dd5-0333-4293-a1aa-ab733e27f642","resolution":{"observed_at":"2026-08-04T20:45:01.229668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17264","last_updated":"2023-03-30T10:01:58Z","snapshot_observed_at":"2026-08-13T12:13:24.036983Z","submitted_at":"2023-03-30T10:01:58Z","title":"Multifactor Sequential Disentanglement via Structured Koopman Autoencoders","version":1},"cited_work":{"arxiv_id":"2303.17264","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.17264","snapshot_observed_at":"2026-08-04T20:45:00.710486Z","title":"Multifactor Sequential Disentanglement via Structured Koopman Autoencoders","venue":"cs.LG","work_id":"f5d149df-97ee-44e9-903b-db7dbe3b7358","year":2023},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.075667Z"},"links":{"cited_paper":"/paper/2303.17264","citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:2a374d7ee7302693f80658f8052ba21cf1e6ca0238065d568654922c075762f7","observation_id":"20e748f4-9b94-455f-bbad-d9bd9f825113","resolution":{"observed_at":"2026-08-04T20:45:00.713886Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2406.18131","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:45:00.697403Z","title":"Sequential disentanglement by extracting static information from a single sequence element.arXiv preprint arXiv:2406.18131, 2024","venue":null,"work_id":"5e1d2258-011d-4478-8440-0125c1c57d9a","year":2024},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.153908Z"},"links":{"citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:bb57a388cddf1b0bb1a3ca92fd36138aed566f905bd1466ea7ae6ed62a3c86bb","observation_id":"de86d914-4d0a-48dd-b670-10a2f1f27d10","resolution":{"observed_at":"2026-08-04T20:45:00.701740Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:45:01.217504Z","title":"Align your latents: High-resolution video synthesis with la- tent diffusion models","venue":null,"work_id":"e3c8cae5-ce83-4a84-afbf-15d65c045601","year":2023},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.224278Z"},"links":{"citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:779d776b1a3a4d993782d85fc22ae438f8035c38bb26028f5d062667d0a83cfe","observation_id":"73e9f7fd-319f-4328-bb41-a53466d4c0de","resolution":{"observed_at":"2026-08-04T20:45:01.220646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:45:01.208339Z","title":"Hyperreenact: One-shot reenactment via jointly learning to refine and re- target faces","venue":null,"work_id":"2f43142e-2d09-4e03-bdbc-3e2bd2a07368","year":2023},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.298984Z"},"links":{"citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:071d9bcc006beb19f4270866f7e13f0f7fd1f9d3fc71a1b6ef320ae8a579212f","observation_id":"b3ce3522-5d8e-4090-837b-0088d8923cb3","resolution":{"observed_at":"2026-08-04T20:45:01.211345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:45:00.415445Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.415445Z"},"links":{"citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:254ef18e5ebf18b936148bae07794ac1d0cf7a2906e763801e04a3543ad03afd","observation_id":"70f5d5ea-f248-4cd3-b662-e7d52ff9eecf","resolution":{"observed_at":"2026-08-04T20:45:00.415445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:45:01.193633Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":"266e0231-e867-4618-8e53-5995c49fe6e8","year":2020},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.418327Z"},"links":{"citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:71215bbeb17dc7102e6d011b70420aa0a514a0e73b347e65b043765c1b48a63b","observation_id":"2bb72392-0bb5-4a9b-919c-2cef4aa34018","resolution":{"observed_at":"2026-08-04T20:45:01.196724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:45:00.421031Z","title":"John Wiley & Sons, 1999","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.421031Z"},"links":{"citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:05da8b8da4b07f58e02e0ac40f4d56eca0a4492e1592241d60ef63eea5529c98","observation_id":"b87743df-5568-4186-bbb6-fb1839a28052","resolution":{"observed_at":"2026-08-04T20:45:00.421031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:45:01.179241Z","title":"Arcface: Additive angular margin loss for deep face recognition","venue":null,"work_id":"721980bd-9343-4800-ab4e-5a6f624b33a3","year":2019},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.423553Z"},"links":{"citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:6cc1973238d02962cec00ad3db0f9402e48fcfe3704d802bb78673f385c74915","observation_id":"b715efbc-f76b-4b14-8f0c-1ac7e879d153","resolution":{"observed_at":"2026-08-04T20:45:01.182143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:45:01.141988Z","title":"Accurate 3d face reconstruction with weakly-supervised learning: From single image to image set","venue":null,"work_id":"179e8cd6-6aa5-471f-a892-6acde276f8e0","year":2019},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.425962Z"},"links":{"citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:b54df4997e725771b6ffb2514eef3c01fd66a8ce1a0e79851a30829bee460a68","observation_id":"4e9dfeb7-de44-489c-8ff6-a105ca0a81a9","resolution":{"observed_at":"2026-08-04T20:45:01.157518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T14:19:26.598265Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-04T20:45:00.428335Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale.arXiv preprint arXiv:2010.11929, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.428335Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:74b6462a5b011353e4a97148f42ec4a0153857a02323d73dfafcf91d245563a1","observation_id":"fb3c9666-72f8-46a7-a219-1cc77241c2a4","resolution":{"observed_at":"2026-08-04T20:45:00.428335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:45:01.103230Z","title":"Headgan: One-shot neural head synthesis and editing","venue":null,"work_id":"a8dae226-554f-4ecf-a4ff-52eb81966a61","year":2021},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.431015Z"},"links":{"citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:1a0daf7d38b208e6471399974c77044056b01ddb9c1a32cbc3e04e91487bc06a","observation_id":"88c1bdb6-a236-43ee-abee-22ebefa460df","resolution":{"observed_at":"2026-08-04T20:45:01.115880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:45:00.433379Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.433379Z"},"links":{"citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:08469b8350a7e04934830c8396a5a4d6324e206ebf702c6ca8323a0d4e1add4c","observation_id":"a04ce27b-8f09-43d8-ab36-c0da17d58f8d","resolution":{"observed_at":"2026-08-04T20:45:00.433379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:45:01.056295Z","title":"High-fidelity and freely controllable talking head video generation","venue":null,"work_id":"21d5e6f7-0170-48d4-bad0-86155da7585b","year":2023},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.436631Z"},"links":{"citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:d1a430f8feee24097560e50cdfa01e5419258a166c6ae4be7b67d704ccd4bafc","observation_id":"49aa3b0b-c009-4d71-ad6d-967eb51d2e41","resolution":{"observed_at":"2026-08-04T20:45:01.066815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:45:01.045270Z","title":"Implicit mo- tion function","venue":null,"work_id":"889c0a8c-1214-4593-ad9c-bd16ee9a6cb1","year":2024},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.439277Z"},"links":{"citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:d1f8880134fe04336b1d2847111e2c6b7a08c23180125d1ca06827a60c3ab075","observation_id":"86275689-670c-4da0-a82c-7f96334106ed","resolution":{"observed_at":"2026-08-04T20:45:01.048407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:45:01.036188Z","title":"Generative adversarial nets.Advances in neural information processing systems, 27, 2014","venue":null,"work_id":"d2836cb5-9fd3-4daf-a8bd-debb19fe4e65","year":2014},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.441741Z"},"links":{"citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:81776a311436ec3062ef3ff10d787f3d7393bb3a2447d9330fd58fc7a68979d4","observation_id":"b0bc3d1d-9095-4073-99d7-3a1ab4fde155","resolution":{"observed_at":"2026-08-04T20:45:01.039310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:45:01.027274Z","title":"Neu- ral head avatars from monocular rgb videos","venue":null,"work_id":"5a5626e0-3816-49bf-b736-ef8d543e8a23","year":2022},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.444245Z"},"links":{"citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:c987e29837ea054c3495457f77ce687fda53396cee0320c77095dd4985c2f899","observation_id":"6f7104ae-6eff-4679-b49b-90443825292c","resolution":{"observed_at":"2026-08-04T20:45:01.030206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:45:00.446697Z","title":"Bootstrap your own latent-a new approach to self-supervised learning.Advances in neural information processing systems, 33:21271–21284, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.446697Z"},"links":{"citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:e0d3263714fbe0308dbde3e764c5dd766ab7b1f73810b94bda4a906069f51da5","observation_id":"ff8efd54-27c6-452e-9ca7-8365de2220cd","resolution":{"observed_at":"2026-08-04T20:45:00.446697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:45:01.011391Z","title":"Vec- tor quantized diffusion model for text-to-image synthesis","venue":null,"work_id":"db1c9393-3bd5-44a8-8f96-7afb92c542ed","year":2022},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.449095Z"},"links":{"citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:f856ac47f9febd5ff1460fa0af0feaeac23e60b48a2966f9bfc0172f3e870cc8","observation_id":"44ade7db-6d7e-4c68-873a-71593b8151d2","resolution":{"observed_at":"2026-08-04T20:45:01.014558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03168","last_updated":"2025-02-28T14:39:17Z","snapshot_observed_at":"2026-08-12T23:29:32.785823Z","submitted_at":"2024-07-03T14:41:39Z","title":"LivePortrait: Efficient Portrait Animation with Stitching and Retargeting Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03168","snapshot_observed_at":"2026-08-04T20:45:00.451507Z","title":"Livepor- trait: Efficient portrait animation with stitching and retarget- ing control.arXiv preprint arXiv:2407.03168, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.451507Z"},"links":{"cited_paper":"/paper/2407.03168","citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:c66deb50050a10cf04bb5f17f5036803627ed153a90db813f5e5fd35d25086d6","observation_id":"bcf74821-70c3-4c65-b0f7-67f2497ff54f","resolution":{"observed_at":"2026-08-04T20:45:00.451507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.07496","last_updated":"2021-01-19T07:43:25Z","snapshot_observed_at":"2026-08-13T11:52:30.132261Z","submitted_at":"2021-01-19T07:43:25Z","title":"Disentangled Recurrent Wasserstein Autoencoder","version":1},"cited_work":{"arxiv_id":"2101.07496","doi":null,"metadata_source":"pith","pith_arxiv_id":"2101.07496","snapshot_observed_at":"2026-08-04T20:45:00.667918Z","title":"Disentangled Recurrent Wasserstein Autoencoder","venue":"cs.LG","work_id":"f7922602-a7e7-4f83-b9a7-03f5552174f7","year":2021},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.454436Z"},"links":{"cited_paper":"/paper/2101.07496","citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:3ab55dadcbb360b6d80730edfc302f405259da49d558d515f3fecf17fd6b3e2a","observation_id":"7ead3c4c-078f-4d97-a94e-7aa2969e32be","resolution":{"observed_at":"2026-08-04T20:45:00.671223Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:45:00.457205Z","title":"Momentum contrast for unsupervised visual rep- resentation learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.457205Z"},"links":{"citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:d99eb352472b2b3e74e3305c79eb9bcef09141d87b314b94a36a7dbfbee3b26f","observation_id":"b29780c0-0c41-4f32-a9f5-e455b60e919c","resolution":{"observed_at":"2026-08-04T20:45:00.457205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:45:00.459760Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.459760Z"},"links":{"citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:871f864e7442a2eff9107a7331b98752d1e960a97666542bb75f8f54b60a8d45","observation_id":"cc1637b3-7c5b-4428-85e8-7e30110622eb","resolution":{"observed_at":"2026-08-04T20:45:00.459760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:45:00.991685Z","title":"Look ma, no markers: holistic perfor- mance capture without the hassle.ACM Transactions on Graphics (TOG), 43(6), 2024","venue":null,"work_id":"8e0aa249-41d4-40aa-bf2c-23512e0105bc","year":2024},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.462180Z"},"links":{"citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:6eec1066818fe371ace108bdfa5f19f1d903c48456b7e5e8001380087cace9a6","observation_id":"b709d873-022d-4fcb-bab2-6a660130f0ab","resolution":{"observed_at":"2026-08-04T20:45:00.994554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:45:00.983233Z","title":"Denoising dif- fusion probabilistic models.Advances in neural information processing systems, 33:6840–6851, 2020","venue":null,"work_id":"201415a9-fd4e-4d86-b142-3b980083923d","year":2020},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.464875Z"},"links":{"citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:44aa2a10ee64e1b26caad607fc742c938839aa25f668b834a16e2985db9614f7","observation_id":"64d96769-e8ce-4192-8b4c-414f0c53c7fc","resolution":{"observed_at":"2026-08-04T20:45:00.986140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:45:00.974430Z","title":"Implicit identity representation conditioned memory compensation network for talking head video generation","venue":null,"work_id":"f756b9fe-3f41-4a40-bc1b-5a33f03fb184","year":2023},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.467256Z"},"links":{"citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:15434c8b06cf78f0ddd3552ab61a8eda48ecb756a0529af5fbb6520a4355745e","observation_id":"94c082b6-9692-404e-8b0d-ff3f2410cad3","resolution":{"observed_at":"2026-08-04T20:45:00.977741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:45:00.965745Z","title":"Neu- ral compression-based feature learning for video restoration","venue":null,"work_id":"3ac3ae92-a9ed-43df-9a42-a82045119e10","year":2022},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.469710Z"},"links":{"citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:3469155637b210471a7e08e0fdb05d0c8aafb559b100328073605f7caf2f0ccf","observation_id":"9bd9ac8e-a9e5-4d05-9f0c-3d555b016df5","resolution":{"observed_at":"2026-08-04T20:45:00.968649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17901","last_updated":"2023-11-29T18:53:34Z","snapshot_observed_at":"2026-08-13T05:14:11.310260Z","submitted_at":"2023-11-29T18:53:34Z","title":"SODA: Bottleneck Diffusion Models for Representation Learning","version":1},"cited_work":{"arxiv_id":"2311.17901","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.17901","snapshot_observed_at":"2026-08-04T20:45:00.653302Z","title":"SODA: Bottleneck Diffusion Models for Representation Learning","venue":"cs.CV","work_id":"c890812f-0272-456c-8b9d-0fad11d5af09","year":2023},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.472120Z"},"links":{"cited_paper":"/paper/2311.17901","citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:1c9ab4eaad3855c9ec731b025eaa1574ae71c3decedf7dd946e8d11c697c5cf5","observation_id":"3ed504cd-42f7-4e60-9833-97acbc02542e","resolution":{"observed_at":"2026-08-04T20:45:00.658366Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:45:00.956994Z","title":"Dis- entangled feature learning for real-time neural speech cod- ing","venue":null,"work_id":"23939d72-d39f-48d5-b219-6e1d2708f2a3","year":2023},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.474731Z"},"links":{"citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:83cb744058c109e2713ed1d434744521356a60ade10da8ff2261a13cfe00eed3","observation_id":"48b15062-8264-467c-821b-010c7e25f131","resolution":{"observed_at":"2026-08-04T20:45:00.959832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:45:00.947532Z","title":"Elucidating the design space of diffusion-based generative models.Advances in Neural Information Processing Sys- tems, 35:26565–26577, 2022","venue":null,"work_id":"685e7a47-dbd3-4bcd-8efb-0d437f831d06","year":2022},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.477767Z"},"links":{"citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:0d5e0f49f2ff4cfa5a4a6c8e8c407a8796c677f9d03fc671724083b2e4170d7b","observation_id":"bbbdfc4e-e55d-40d0-a69b-fa9f73034fcc","resolution":{"observed_at":"2026-08-04T20:45:00.950778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:45:00.938516Z","title":"Deep contextual video com- pression.Advances in Neural Information Processing Sys- tems, 34:18114–18125, 2021","venue":null,"work_id":"e87e646f-0970-4a39-9125-36e294e256d5","year":2021},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.480229Z"},"links":{"citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:edb3d1a9322587c7f69e487c6459772162814d7ab2cd81cbc84d962153d00357","observation_id":"1beb5af6-5393-4386-ab3d-b7f890b1aa37","resolution":{"observed_at":"2026-08-04T20:45:00.941726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:45:00.929762Z","title":"Hybrid spatial-temporal en- tropy modelling for neural video compression","venue":null,"work_id":"4e69ee99-dcb0-4ee7-bc45-68ba06bb2518","year":2022},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.482629Z"},"links":{"citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:df7658b41b3e33c3fdf3acfb0a129a5a1ac0e5d3e7f449bbc75568e16548c5c2","observation_id":"0647afbd-ee36-4294-a2e9-db02df80d2a2","resolution":{"observed_at":"2026-08-04T20:45:00.932611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:45:00.920398Z","title":"Neural video compression with diverse contexts","venue":null,"work_id":"30bac177-ca93-4060-a8ea-65d1c5f31d55","year":2023},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.485089Z"},"links":{"citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:563711437fbb81867d3010aa7f8e4b2ff9612d15568d8416f4e86f68c1cdd6ae","observation_id":"77b4db0a-4aca-41d5-a7ad-1549fc582590","resolution":{"observed_at":"2026-08-04T20:45:00.923240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-08-12T12:01:54.105712Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-04T20:45:00.487487Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models.arXiv preprint arXiv:2301.12597, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.487487Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:9555f71718cecfc24426a6897e311990527d2d84145abc12aa84ecacdb2949ed","observation_id":"8db2abca-719e-4ffa-a2f8-3a41cd3ed4df","resolution":{"observed_at":"2026-08-04T20:45:00.487487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:45:00.911669Z","title":"Motion-focused contrastive learning of video representations","venue":null,"work_id":"6362ddd3-412f-429c-b184-56614ca3b606","year":null},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.490123Z"},"links":{"citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:8712f57b37d01e70b1c8d9229ae40f51d7a84602c3a379191de66b6dd2bbc7df","observation_id":"daff29dc-a889-453b-8aff-de3e3b308a8d","resolution":{"observed_at":"2026-08-04T20:45:00.914474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03701","last_updated":"2024-11-01T14:48:57Z","snapshot_observed_at":"2026-08-13T05:08:29.535380Z","submitted_at":"2023-12-06T18:59:31Z","title":"Return of Unconditional Generation: A Self-supervised Representation Generation Method","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.03701","snapshot_observed_at":"2026-08-04T20:45:00.492768Z","title":"Self- conditioned image generation via generating representations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.492768Z"},"links":{"cited_paper":"/paper/2312.03701","citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:a8caf3efb48853910610e70a67fbd14dae44e16f68ae20982b18638a8e3a63b7","observation_id":"209ba1d1-a78d-4e50-a545-22f8de9a3053","resolution":{"observed_at":"2026-08-04T20:45:00.492768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.02991","last_updated":"2018-06-12T17:18:55Z","snapshot_observed_at":"2026-07-06T06:27:12.758357Z","submitted_at":"2018-03-08T07:42:39Z","title":"Disentangled Sequential Autoencoder","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.02991","snapshot_observed_at":"2026-08-04T20:45:00.495406Z","title":"Disentangled sequential autoencoder.arXiv preprint arXiv:1803.02991, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.495406Z"},"links":{"cited_paper":"/paper/1803.02991","citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:729f8533cdaffa77748f078e6a6c3b9620b9f5d08aea6dc934258ff021a62f2b","observation_id":"6983b08e-cd67-4bab-b698-8fee569afcba","resolution":{"observed_at":"2026-08-04T20:45:00.495406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:45:00.902718Z","title":"Anitalker: animate vivid and di- verse talking faces through identity-decoupled facial motion encoding","venue":null,"work_id":"ddf93bd6-7097-4512-9486-3374224c76a6","year":2024},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.498188Z"},"links":{"citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:f04e8f28aa34fc65ef781d87c2d9b39debbf5aa78eb156297c6b0811c1c7df6d","observation_id":"c087c444-9eb8-41a3-b8a4-f48e1bf50842","resolution":{"observed_at":"2026-08-04T20:45:00.905789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-04T20:45:00.500592Z","title":"Decoupled weight decay regularization.arXiv preprint arXiv:1711.05101, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.500592Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:0d95c9f6c01b0065f1f5feb020b153e48a6841e0fafb5d77dca59fd6c3ab9476","observation_id":"46a7caf5-e4e9-4048-b0b2-df716ddefb6a","resolution":{"observed_at":"2026-08-04T20:45:00.500592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:45:00.893827Z","title":"Implicit warping for animation with image sets.Advances in Neural Information Processing Systems, 35:22438–22450, 2022","venue":null,"work_id":"926ec0aa-71a5-408f-bd93-0c59d6dc32f0","year":2022},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.502984Z"},"links":{"citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:1926bf5d7e0aa5fc82038feba59de302a0d327df2cf00ed6f20b9cc108d3c399","observation_id":"2961290c-86bc-4dfb-bb57-e2d2afee2176","resolution":{"observed_at":"2026-08-04T20:45:00.896743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:45:00.885102Z","title":"Sample and predict your latent: modality-free sequential disentan- glement via contrastive estimation","venue":null,"work_id":"381b2b2e-c016-486c-87d3-03687a053051","year":null},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.505418Z"},"links":{"citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:022f39977bec3c8c651103f999f4a00be604931360b20cbf49c4c5227127e3c4","observation_id":"1a5cc352-2b5e-4a1b-9eb5-47416e825300","resolution":{"observed_at":"2026-08-04T20:45:00.887939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:45:00.507990Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.507990Z"},"links":{"citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:43352d460b95c4693234d492a4650d50258a87cad5cd2bbae9859ce9fb0c5295","observation_id":"4cf92cb0-e99f-4eea-90d8-d530ade0e742","resolution":{"observed_at":"2026-08-04T20:45:00.507990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06366","last_updated":"2022-10-03T11:47:10Z","snapshot_observed_at":"2026-08-13T14:45:57.387723Z","submitted_at":"2022-08-12T16:48:10Z","title":"BEiT v2: Masked Image Modeling with Vector-Quantized Visual Tokenizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.06366","snapshot_observed_at":"2026-08-04T20:45:00.510559Z","title":"Beit v2: Masked image modeling with vector-quantized visual tokenizers.arXiv preprint arXiv:2208.06366, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.510559Z"},"links":{"cited_paper":"/paper/2208.06366","citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:efc99ae954a07b35c35cc897885b299d6fe497da06d7ac302a7a7ef5f00eca1a","observation_id":"bccd00af-3f1f-4671-abb2-1cbe3714043b","resolution":{"observed_at":"2026-08-04T20:45:00.510559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:45:00.870212Z","title":"Language models are unsu- pervised multitask learners.OpenAI blog, 1(8):9, 2019","venue":null,"work_id":"36c086d9-f326-4480-9750-c690af4f21b8","year":2019},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.513304Z"},"links":{"citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:e5d25d3ca9bf8f1c7b09266a26a18925ce8b2411534fea0e55db28dffaf1b730","observation_id":"b3b02db2-c1a0-43d9-b520-0c1210ba4ca7","resolution":{"observed_at":"2026-08-04T20:45:00.873180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:45:00.515665Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.515665Z"},"links":{"citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:793c5430b232fdcdc08eaebd28e9635dcf0b3d395300752146f5c90dc32a49fd","observation_id":"5bc423be-4c77-4d2f-a436-9e3dc23ac74f","resolution":{"observed_at":"2026-08-04T20:45:00.515665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:45:00.854072Z","title":"Deep visual analogy-making.Advances in neural informa- tion processing systems, 28, 2015","venue":null,"work_id":"9e4d6b4e-3767-4760-a3c8-eb5b460b1a8d","year":2015},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.518294Z"},"links":{"citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:66fca96541745c14effac16d95a49bc9d62c77b171b4b91eb6cee5093a1aa076","observation_id":"674dd3b9-d95f-4808-b7c0-ed6286fe2915","resolution":{"observed_at":"2026-08-04T20:45:00.856960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:45:00.520776Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.520776Z"},"links":{"citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:981befb2c38e8b6854f0ac046604b92ede551b49aef40dd8e637d519463e67ef","observation_id":"1e3365b7-6ffa-4f63-ba65-c965aef37c9d","resolution":{"observed_at":"2026-08-04T20:45:00.520776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:45:00.838818Z","title":"Temporal context mining for learned video compression","venue":null,"work_id":"b42fa850-a26e-44d3-8383-9574039cbec3","year":2022},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.523096Z"},"links":{"citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:c075ed810ac8804d88f2f6f611c231d0b497b9edffa361e59b5cdbea7f610741","observation_id":"5860d4c5-2bfb-4557-ab95-6b51ee07dc49","resolution":{"observed_at":"2026-08-04T20:45:00.841937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:45:00.830016Z","title":"First order motion model for image animation.Advances in neural information processing systems, 32, 2019","venue":null,"work_id":"fe2c210f-37af-434a-9c1b-ade027097d03","year":2019},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.525513Z"},"links":{"citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:1c27eff70e2b6778107b85d29b239eb4e860987d5acc85b4dceb5cb3a51182cd","observation_id":"5f425ff5-c232-4608-96bb-c7eea3a9a316","resolution":{"observed_at":"2026-08-04T20:45:00.832906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:45:00.821204Z","title":"Sequential representation learning via static- dynamic conditional disentanglement","venue":null,"work_id":"b3f291ab-d972-48d0-bb89-de437d91f937","year":2024},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.527999Z"},"links":{"citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:1564fc7e288c0af7daa85491c889777ae1fe41bc06568aec91f23f523decb493","observation_id":"4696cc0b-b4d9-4315-b298-6c1caf427c42","resolution":{"observed_at":"2026-08-04T20:45:00.824126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"physics/0004057","last_updated":"2000-04-24T15:22:30Z","snapshot_observed_at":"2026-08-12T16:03:20.142135Z","submitted_at":"2000-04-24T15:22:30Z","title":"The information bottleneck method","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"physics/0004057","snapshot_observed_at":"2026-08-04T20:45:00.530551Z","title":"The information bottleneck method.arXiv preprint physics/0004057, 2000","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.530551Z"},"links":{"cited_paper":"/paper/physics/0004057","citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:0ac3ac3a7c69da6d08c17b35fe752807d764bcc674912d0123231d77b73ca9ee","observation_id":"fb1e53ab-5faf-40eb-a054-d59259d2bb16","resolution":{"observed_at":"2026-08-04T20:45:00.530551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:45:00.533176Z","title":"Neural discrete representation learning.Advances in neural information pro- cessing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.533176Z"},"links":{"citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:ba2bfc157a567e24d6ffabcbcc0789a9d5ae9aeb1aef2e751a1f496dccc0ba71","observation_id":"f0233383-231b-422f-b2c6-26a17a180104","resolution":{"observed_at":"2026-08-04T20:45:00.533176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:45:00.535702Z","title":"Attention is all you need.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.535702Z"},"links":{"citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:ffaed73b3ecd35770ba67cb75449cca2b5dca154176b8e60237294022531b62f","observation_id":"1fcc528c-460b-4999-bc8e-573478ae28a0","resolution":{"observed_at":"2026-08-04T20:45:00.535702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:45:00.800515Z","title":"One-shot free-view neural talking-head synthesis for video conferenc- ing","venue":null,"work_id":"5becf19f-75ea-44da-b578-f9201498ee03","year":null},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.538306Z"},"links":{"citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:facbee90d0c209e5ba33e76d5181c917eeeb194eff787ed9ba6fe4eb9f0cf127","observation_id":"aa47434a-3805-47b8-a268-411b6ddb71bc","resolution":{"observed_at":"2026-08-04T20:45:00.803471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:45:00.791069Z","title":"Latent image animator: Learning to animate im- ages via latent space navigation","venue":null,"work_id":"a96821f8-868e-4dd5-aebc-6eccb6af07af","year":2021},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.540946Z"},"links":{"citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:436b82a1ae227243d36567248fbdaee5391dcb8fef7babe96a5483d170c96c77","observation_id":"a5a988b9-9fd0-4478-b2c3-d71c924ba1c3","resolution":{"observed_at":"2026-08-04T20:45:00.794245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.03771","last_updated":"2020-07-14T03:42:34Z","snapshot_observed_at":"2026-07-06T08:27:58.343233Z","submitted_at":"2019-10-09T03:23:22Z","title":"HuggingFace's Transformers: State-of-the-art Natural Language Processing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.03771","snapshot_observed_at":"2026-08-04T20:45:00.543485Z","title":"Huggingface’s transformers: State-of-the-art natural language processing","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.543485Z"},"links":{"cited_paper":"/paper/1910.03771","citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:c79c4262b499f78a182a3f4093df4f4dbb3e481fdd1a5ad3bc2c6c0922ffbd02","observation_id":"5124988f-ff46-4de7-91b5-3b70bb00a2d0","resolution":{"observed_at":"2026-08-04T20:45:00.543485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:45:00.781743Z","title":"Fake it till you make it: face analysis in the wild using synthetic data alone","venue":null,"work_id":"a3adc8de-22a8-408f-be16-65ef580145a9","year":2021},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.546104Z"},"links":{"citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:49142ed16eef0d45d06acc6dee40e791436502d9e9fbebbb9c7259803368236c","observation_id":"54cf12a0-594e-42a3-91f4-5092bc7bf123","resolution":{"observed_at":"2026-08-04T20:45:00.784700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:45:00.772327Z","title":"3d face reconstruction with dense landmarks","venue":null,"work_id":"e8507e98-b71f-4945-bf1e-e9b31cd71715","year":2022},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.548524Z"},"links":{"citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:078507e85391a6b12cb4c7f32e565f7edcb03355bfec598040806b5cbca84811","observation_id":"824f66db-771b-4ec6-8bf0-586e645ffb66","resolution":{"observed_at":"2026-08-04T20:45:00.775361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:45:00.763286Z","title":"N ¨uwa: Visual synthesis pre- training for neural visual world creation","venue":null,"work_id":"bf1e1c76-cfbb-4d18-99bf-1798ffe19617","year":2022},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.551119Z"},"links":{"citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:9df7b11854f556b68447731350ba673e579fb623a62b8dd5f382f781796c70d3","observation_id":"d1e3b02f-0a02-47b6-9958-b33230548775","resolution":{"observed_at":"2026-08-04T20:45:00.766313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:45:00.754050Z","title":"Simmim: A simple framework for masked image modeling","venue":null,"work_id":"a1fcde86-975d-4262-a7d1-39a6b172c070","year":2022},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.553618Z"},"links":{"citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:6196f8cf20d3d439bab240a9d8d3171f157729070844105998cf44c230e0610e","observation_id":"d1743a51-6937-4a2c-9b35-75071861155c","resolution":{"observed_at":"2026-08-04T20:45:00.756997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10157","last_updated":"2021-09-14T21:20:06Z","snapshot_observed_at":"2026-08-13T14:30:50.605700Z","submitted_at":"2021-04-20T17:58:03Z","title":"VideoGPT: Video Generation using VQ-VAE and Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.10157","snapshot_observed_at":"2026-08-04T20:45:00.556081Z","title":"Videogpt: Video generation using vq-vae and trans- formers.arXiv preprint arXiv:2104.10157, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.556081Z"},"links":{"cited_paper":"/paper/2104.10157","citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:8c8608ed6ca2582613eb9ace4dffb9edf59516439807bdb9bc17c00aab7a0d9b","observation_id":"566023bf-bb8c-44a6-95c0-bcc90c273c38","resolution":{"observed_at":"2026-08-04T20:45:00.556081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:45:00.744652Z","title":"S3vae: Self-supervised sequential vae for representation disentanglement and data generation","venue":null,"work_id":"d4096860-c0d8-4327-ab85-c6ec4626e528","year":2020},"citing_paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-04T20:45:00.558941Z"},"links":{"citing_paper":"/paper/2509.08376"},"observation_digest":"sha256:f74a07289289cc8e0ab6e69c9f8b1860ce9f7c57dea1bfca5e513e82567140a9","observation_id":"adf97a62-aeaa-42a2-86dd-17dcf09a051d","resolution":{"observed_at":"2026-08-04T20:45:00.747761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.08376","last_updated":"2025-09-10T08:14:45Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T11:57:51.023350Z","submitted_at":"2025-09-10T08:14:45Z","title":"Bitrate-Controlled Diffusion for Disentangling Motion and Content in Video"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":4,"verified_fuzzy":38},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 0 inbound Pith citation observations for arXiv:2509.08376."}