{"as_of":"2026-08-13T09:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:af896b3a26c4dfa45a054b7c072dfad8a985d6786a76a93e62cb8f304fc42396","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:25:55.528521Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T15:09:46.865981Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"cited_work":{"arxiv_id":"2501.01722","doi":"10.48550/arxiv.2501.01722","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.01722","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2501.01722 (2025)","venue":"arXiv (Cornell University)","work_id":"766104c0-8804-4a1b-b08d-df54ddaa12c2","year":2025},"citing_paper":{"arxiv_id":"2606.09187","last_updated":"2026-06-08T08:23:12Z","snapshot_observed_at":"2026-08-12T15:44:08.400536Z","submitted_at":"2026-06-08T08:23:12Z","title":"CP4D: Compositional Physics-aware 4D Scene Generation","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-06-27T16:52:36.288955Z"},"links":{"cited_paper":"/paper/2501.01722","citing_paper":"/paper/2606.09187"},"observation_digest":"sha256:745d5181cabc7b9f70bd184014fb69b34562e3801cd61dc6419f41d5e90ff096","observation_id":"ce779607-71f2-4381-bc57-11d7b348aa6e","resolution":{"observed_at":"2026-07-03T00:57:30.477209Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"cited_work":{"arxiv_id":"2501.01722","doi":"10.48550/arxiv.2501.01722","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.01722","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2501.01722 (2025)","venue":"arXiv (Cornell University)","work_id":"766104c0-8804-4a1b-b08d-df54ddaa12c2","year":2025},"citing_paper":{"arxiv_id":"2606.22131","last_updated":"2026-06-20T16:18:13Z","snapshot_observed_at":"2026-08-06T09:05:20.046435Z","submitted_at":"2026-06-20T16:18:13Z","title":"Feed-forward Motion In-betweening for Any 4D","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-26T12:21:01.979010Z"},"links":{"cited_paper":"/paper/2501.01722","citing_paper":"/paper/2606.22131"},"observation_digest":"sha256:a948fc854efb1969917d2b59f51efb1203d57b6e4518615f04e233fb6a01f5b7","observation_id":"e4ae32d7-b2aa-495f-a6c0-f8768e9309c8","resolution":{"observed_at":"2026-06-26T12:29:28.059344Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"cited_work":{"arxiv_id":"2501.01722","doi":"10.48550/arxiv.2501.01722","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.01722","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2501.01722 (2025)","venue":"arXiv (Cornell University)","work_id":"766104c0-8804-4a1b-b08d-df54ddaa12c2","year":2025},"citing_paper":{"arxiv_id":"2606.25344","last_updated":"2026-06-24T03:18:10Z","snapshot_observed_at":"2026-08-04T18:36:25.340564Z","submitted_at":"2026-06-24T03:18:10Z","title":"Follow Your Track: Precise Skeleton Animation Controlled by 3D Trajectories","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-25T21:12:03.751682Z"},"links":{"cited_paper":"/paper/2501.01722","citing_paper":"/paper/2606.25344"},"observation_digest":"sha256:63b5baddfc63f5ee3a0886982f26b85b597268ec95f490aa7163c172200e7a2a","observation_id":"fb3e193e-4a57-4d2d-bc6f-8c0a73b26a8e","resolution":{"observed_at":"2026-07-04T19:40:06.062435Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01722","snapshot_observed_at":"2026-08-01T15:09:46.865981Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18539","last_updated":"2026-07-20T22:14:03Z","snapshot_observed_at":"2026-08-07T21:35:34.080372Z","submitted_at":"2026-07-20T22:14:03Z","title":"AniGS: Bridging Rendering and Diffusion Prior for 3D Scene Animation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T15:09:46.865981Z"},"links":{"cited_paper":"/paper/2501.01722","citing_paper":"/paper/2607.18539"},"observation_digest":"sha256:4c7175bdfef1f8f877e181b1f618b95225f73980c92c6a4f516837f755f86ba7","observation_id":"0aba1c3d-f863-4c26-bdbf-b691107be888","resolution":{"observed_at":"2026-08-01T15:09:46.865981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2501.01722/citation-record","integrity":"/paper/2501.01722/integrity","json":"/paper/2501.01722/citation-record.json","paper":"/paper/2501.01722"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:25:56.397532Z","title":"Hyperreel: High-fidelity 6-dof video with ray- conditioned sampling","venue":null,"work_id":"89ace22c-8174-46ec-b34e-b1bab829e2bf","year":2023},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.221308Z"},"links":{"citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:8f25fd0ae5c14d59a4bda7ed23c73d1614834a20c781cff667b222577c695f9b","observation_id":"ac187ac8-0c59-437b-bb4d-56bba35e2ab7","resolution":{"observed_at":"2026-08-10T22:25:56.402048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:25:56.380148Z","title":"4d-fy: Text-to-4d generation using hybrid score dis- tillation sampling","venue":null,"work_id":"40dd5e35-3d69-41fc-b170-c9f511379b44","year":2024},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.226788Z"},"links":{"citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:f6072e7a43fbdc613be141122d540e4485c5122ec556889f49cc455753fa9d3e","observation_id":"5668ee21-4407-4e2b-afdf-98b12c1a5987","resolution":{"observed_at":"2026-08-10T22:25:56.386121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12781","last_updated":"2025-03-22T15:40:42Z","snapshot_observed_at":"2026-08-12T23:20:07.594666Z","submitted_at":"2024-07-17T17:59:05Z","title":"VD3D: Taming Large Video Diffusion Transformers for 3D Camera Control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12781","snapshot_observed_at":"2026-08-10T22:25:55.232404Z","title":"Vd3d: Taming large video diffu- sion transformers for 3d camera control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.232404Z"},"links":{"cited_paper":"/paper/2407.12781","citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:196fb642b9b563d3956434b47e7f2a6d7fbf6235da5ebe4069e12fbdbbe49a83","observation_id":"8272e4d1-ad90-4f20-bbb6-59da5e7a5505","resolution":{"observed_at":"2026-08-10T22:25:55.232404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:25:56.360468Z","title":"Tc4d: Trajectory-conditioned text-to-4d generation","venue":null,"work_id":"c7c33728-a31b-4d69-80df-fe2d068f9016","year":null},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.237986Z"},"links":{"citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:cf6a0aa0cd7056ee97926d36c00e5b31bf2c3e39904a2bde350f08e70a3e5f9e","observation_id":"9622abdd-3cde-4c9b-b1b7-3c26f9ceab78","resolution":{"observed_at":"2026-08-10T22:25:56.366161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-10T22:25:55.245383Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.245383Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:e3448ad53b24625f53bf35a95c19f0432222b29b477826d6f4983bd07e32d5f4","observation_id":"2787f60a-a828-4dae-bfee-a372a42d8947","resolution":{"observed_at":"2026-08-10T22:25:55.245383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:25:55.251368Z","title":"Objaverse: A universe of annotated 3d objects","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.251368Z"},"links":{"citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:246b131d1066f0863681aa588aa8a5b7a3384bf0110223b1c2ad8e6e7b149aeb","observation_id":"3af9f115-3871-4f1d-9799-800dede488f3","resolution":{"observed_at":"2026-08-10T22:25:55.251368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12365","last_updated":"2024-05-13T19:06:48Z","snapshot_observed_at":"2026-08-13T00:50:44.324755Z","submitted_at":"2024-03-19T02:22:21Z","title":"GaussianFlow: Splatting Gaussian Dynamics for 4D Content Creation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12365","snapshot_observed_at":"2026-08-10T22:25:55.257309Z","title":"Gaussianflow: Splatting gaussian dynamics for 4d content creation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.257309Z"},"links":{"cited_paper":"/paper/2403.12365","citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:7524e5116f4c9e1fe09b2601c0bd212e033cb29eac821b695d6639c5eac2d251","observation_id":"da3e79aa-4d5d-40c5-b017-47c3b42e5456","resolution":{"observed_at":"2026-08-10T22:25:55.257309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02101","last_updated":"2025-03-13T18:35:06Z","snapshot_observed_at":"2026-08-12T01:27:32.593496Z","submitted_at":"2024-04-02T16:52:41Z","title":"CameraCtrl: Enabling Camera Control for Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02101","snapshot_observed_at":"2026-08-10T22:25:55.262370Z","title":"Cameractrl: Enabling camera control for text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.262370Z"},"links":{"cited_paper":"/paper/2404.02101","citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:1f5d71511c1be135092320ac385299ad9c11d0a0a1c4dbca76f38d22c8540787","observation_id":"55c80ddf-9abb-4c32-a772-a8da4be888ea","resolution":{"observed_at":"2026-08-10T22:25:55.262370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10126","last_updated":"2025-02-25T00:32:29Z","snapshot_observed_at":"2026-08-12T23:42:35.070916Z","submitted_at":"2024-06-14T15:33:00Z","title":"Training-free Camera Control for Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10126","snapshot_observed_at":"2026-08-10T22:25:55.267718Z","title":"Training-free camera control for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.267718Z"},"links":{"cited_paper":"/paper/2406.10126","citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:12b22006d6ce509d7a973b991f0f7b035537018527d2beca718d70c929f4ba62","observation_id":"f9e11057-ca17-412e-917f-f969b38d1782","resolution":{"observed_at":"2026-08-10T22:25:55.267718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11398","last_updated":"2024-09-09T06:21:21Z","snapshot_observed_at":"2026-08-12T23:21:26.733824Z","submitted_at":"2024-07-16T05:35:57Z","title":"Animate3D: Animating Any 3D Model with Multi-view Video Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11398","snapshot_observed_at":"2026-08-10T22:25:55.273568Z","title":"Animate3d: Animating any 3d model with multi-view video diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.273568Z"},"links":{"cited_paper":"/paper/2407.11398","citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:1cfece90084c848e0f6864bc77c4511082ecea31fdcb87524aafd09cfb5d4278","observation_id":"827a5666-6b0f-460a-8539-60991774bb10","resolution":{"observed_at":"2026-08-10T22:25:55.273568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:25:56.331812Z","title":"Consistent4d: Consistent 360 {\\deg} dynamic object gener- ation from monocular video","venue":null,"work_id":"527871d9-ef8c-46d9-9903-cca00323b8bd","year":2024},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.279430Z"},"links":{"citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:a1491f07dca5e7550d630755d2723ac0f6ace69ad6a697756b11ae7e3902d5e9","observation_id":"31667c08-6544-418a-8d8e-d53bf588752b","resolution":{"observed_at":"2026-08-10T22:25:56.337974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:25:55.283775Z","title":"3d gaussian splatting for real-time radiance field rendering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.283775Z"},"links":{"citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:7845c77a301922792ff5f984fd11901116c83cd14cc63f931bafcdd7884f06e8","observation_id":"d9556d85-c66e-49b1-b559-8d3e0f06e65a","resolution":{"observed_at":"2026-08-10T22:25:55.283775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08659","last_updated":"2024-06-12T21:44:04Z","snapshot_observed_at":"2026-08-13T05:57:40.453283Z","submitted_at":"2024-06-12T21:44:04Z","title":"Vivid-ZOO: Multi-View Video Generation with Diffusion Model","version":1},"cited_work":{"arxiv_id":"2406.08659","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.08659","snapshot_observed_at":"2026-08-10T22:25:55.954014Z","title":"Vivid-ZOO: Multi-View Video Generation with Diffusion Model","venue":"cs.CV","work_id":"0ff9812d-c30f-4bd1-bde6-4009f018a2cc","year":2024},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.288588Z"},"links":{"cited_paper":"/paper/2406.08659","citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:cbca7a6ae6db31c83386f5b5a3074a3f690fa5a2324a233ac83c10f7e4f70aed","observation_id":"d996f46c-c7a6-4a32-9055-3104d9ce1cc5","resolution":{"observed_at":"2026-08-10T22:25:55.959273Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06756","last_updated":"2024-10-09T10:41:08Z","snapshot_observed_at":"2026-08-12T22:27:23.759715Z","submitted_at":"2024-10-09T10:41:08Z","title":"DreamMesh4D: Video-to-4D Generation with Sparse-Controlled Gaussian-Mesh Hybrid Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06756","snapshot_observed_at":"2026-08-10T22:25:55.293116Z","title":"Dreammesh4d: Video-to-4d generation with sparse-controlled gaussian-mesh hybrid representation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.293116Z"},"links":{"cited_paper":"/paper/2410.06756","citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:85ac32cf087154c94aaacf71fa3f1284e3a5ed865742c3161343af7eac0b84df","observation_id":"154da7ec-1903-42d8-a3ef-b2fe2cdad257","resolution":{"observed_at":"2026-08-10T22:25:55.293116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:25:55.298927Z","title":"Spacetime gaus- sian feature splatting for real-time dynamic view synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.298927Z"},"links":{"citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:e7dd89ef2233a07fb2c2ef1a7f59d736250b849fb49b11723757b8e94e399134","observation_id":"ab9267d5-09a9-4e56-a21c-8b140cfbd8c1","resolution":{"observed_at":"2026-08-10T22:25:55.298927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16645","last_updated":"2024-05-26T17:47:34Z","snapshot_observed_at":"2026-08-12T23:57:41.828438Z","submitted_at":"2024-05-26T17:47:34Z","title":"Diffusion4D: Fast Spatial-temporal Consistent 4D Generation via Video Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16645","snapshot_observed_at":"2026-08-10T22:25:55.303806Z","title":"Diffusion4d: Fast spatial-temporal consis- tent 4d generation via video diffusion models.arXiv preprint arXiv:2405.16645, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.303806Z"},"links":{"cited_paper":"/paper/2405.16645","citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:7b6511e9703ada4408c757a5f728d7eb0f948b0a9d1e46af84a4666e60572045","observation_id":"81ba0f20-589f-4120-840c-fb4394ce645d","resolution":{"observed_at":"2026-08-10T22:25:55.303806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:25:56.294653Z","title":"Luciddreamer: Towards high- fidelity text-to-3d generation via interval score matching","venue":null,"work_id":"6b166624-9666-4c61-aef2-717bf0fd5cbc","year":2024},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.308554Z"},"links":{"citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:7878986e68f4b14ced8ea528004620e37fb35e261b2fb243a7421ece5d8e44c8","observation_id":"8708bc44-a8a7-43ee-89e8-4f78f30885d4","resolution":{"observed_at":"2026-08-10T22:25:56.299890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:25:56.280163Z","title":"Align your gaussians: Text-to-4d with dynamic 3d gaussians and composed diffusion models","venue":null,"work_id":"56bba86f-7ef3-4644-b3c0-127dc2685935","year":2024},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.313307Z"},"links":{"citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:9b98abd3f7a1e76e2a95bac757b45dfb37ff12924b4cc0b2810b4c5ead793a8a","observation_id":"8ad5c261-7b40-400c-bc30-20c829f95cb6","resolution":{"observed_at":"2026-08-10T22:25:56.284937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:25:56.265076Z","title":"One-2-3-45: Any single image to 3d mesh in 45 seconds without per-shape optimiza- tion","venue":null,"work_id":"6a2ac714-9ff3-426c-aeb9-06315950a7c7","year":2024},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.319223Z"},"links":{"citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:c525185b71aafddf1651b39ef8cb8973da201600bd4a0e050ef08a9e115eef28","observation_id":"8a09c225-3808-4951-b8b1-a1f30bbf60f9","resolution":{"observed_at":"2026-08-10T22:25:56.270429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:25:56.250302Z","title":"Zero-1-to- 3: Zero-shot one image to 3d object","venue":null,"work_id":"d24218c8-63e8-4192-a055-fec65d3eda9a","year":2023},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.325133Z"},"links":{"citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:4ed91c4bfbfa932c3bc3648e122c791149f615e1d0d56cd038b5d3a291ebd900","observation_id":"607ed7cb-cd97-4fc2-b02f-be95dcc8719c","resolution":{"observed_at":"2026-08-10T22:25:56.255827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03453","last_updated":"2024-04-15T10:28:44Z","snapshot_observed_at":"2026-08-12T22:52:54.817720Z","submitted_at":"2023-09-07T02:28:04Z","title":"SyncDreamer: Generating Multiview-consistent Images from a Single-view Image","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.03453","snapshot_observed_at":"2026-08-10T22:25:55.330274Z","title":"Syncdreamer: Gen- erating multiview-consistent images from a single-view im- age","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.330274Z"},"links":{"cited_paper":"/paper/2309.03453","citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:4a87fd4d8de51861597c42d0432a19ca0c85533013b202069f728e68d8ed00b6","observation_id":"2eb9b73c-69b7-4522-8072-94dc79fbb68c","resolution":{"observed_at":"2026-08-10T22:25:55.330274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:25:55.335153Z","title":"Wonder3d: Sin- gle image to 3d using cross-domain diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.335153Z"},"links":{"citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:824ddebc4430ded04760f69512c6f434dc09acb7033dde5d4718ddf0709215a6","observation_id":"01a9e790-e709-4424-bea7-d3a5524f42b3","resolution":{"observed_at":"2026-08-10T22:25:55.335153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19957","last_updated":"2024-11-19T02:12:54Z","snapshot_observed_at":"2026-08-12T23:54:17.618567Z","submitted_at":"2024-05-30T11:23:01Z","title":"PLA4D: Pixel-Level Alignments for Text-to-4D Gaussian Splatting","version":4},"cited_work":{"arxiv_id":"2405.19957","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.19957","snapshot_observed_at":"2026-08-10T22:25:55.892206Z","title":"PLA4D: Pixel-Level Alignments for Text-to-4D Gaussian Splatting","venue":"cs.CV","work_id":"aebf0f3a-d424-4e03-a47e-0e8c65a664d5","year":2024},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.339931Z"},"links":{"cited_paper":"/paper/2405.19957","citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:18e5b971fc1881fb30ca680c4604d059412bf42128f1cc06853efb43676b0449","observation_id":"a092987f-c37f-4eda-bd13-4afa7011ec56","resolution":{"observed_at":"2026-08-10T22:25:55.897202Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:25:55.344632Z","title":"Nerf: Representing scenes as neural radiance fields for view syn- thesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.344632Z"},"links":{"citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:f1bdacc3b402435c529d8d889432e478fd922dcdaef0bb76b4e0aca09ee42a36","observation_id":"b29c3173-dab6-4ac9-ba7b-98086e5f65fe","resolution":{"observed_at":"2026-08-10T22:25:55.344632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:25:55.350029Z","title":"T2i-adapter: Learning adapters to dig out more controllable ability for text-to-image diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.350029Z"},"links":{"citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:6b3b07528b20f22983ed503b894fb3f50b319adf5fa62ac63138e1431e2ef055","observation_id":"a027ce41-23eb-4d84-a093-58bf34af78e0","resolution":{"observed_at":"2026-08-10T22:25:55.350029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:25:56.206261Z","title":"Reg- nerf: Regularizing neural radiance fields for view synthesis from sparse inputs","venue":null,"work_id":"92d0ddef-3ddc-476e-a528-5ed681db359b","year":2022},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.358751Z"},"links":{"citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:dd416d0bdc9e9c10ab3312c379505d138a0d5422b9918834aa8ed748acb6762e","observation_id":"06542d68-efd5-4852-be6c-7621a1adcf6e","resolution":{"observed_at":"2026-08-10T22:25:56.210867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-10T22:25:55.365367Z","title":"Sdxl: Improving latent diffusion mod- els for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.365367Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:ea8c5fd4da78374626b48fc9b18ffe926b6aa9182610cb0636be110be4c9c295","observation_id":"e71f31b3-e8c7-4c7a-b8b8-eb24b4f1aa5e","resolution":{"observed_at":"2026-08-10T22:25:55.365367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14988","last_updated":"2022-09-29T17:50:40Z","snapshot_observed_at":"2026-07-06T13:57:54.539656Z","submitted_at":"2022-09-29T17:50:40Z","title":"DreamFusion: Text-to-3D using 2D Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14988","snapshot_observed_at":"2026-08-10T22:25:55.370427Z","title":"Dreamfusion: Text-to-3d using 2d diffusion","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.370427Z"},"links":{"cited_paper":"/paper/2209.14988","citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:b4dbc1639c95dad25f3532c6e03a2d4e5bdeebec14db7b4cffe13ce4749d0d66","observation_id":"32acf034-f4b6-4149-84fe-8cf4e662266c","resolution":{"observed_at":"2026-08-10T22:25:55.370427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:25:55.378312Z","title":"D-nerf: Neural radiance fields for dynamic scenes","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.378312Z"},"links":{"citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:d9867baf443c4cbe07306edbe610db997a79837b76882b2b4e68c6880e5d0d5b","observation_id":"9bac6172-8bfe-4310-95ba-2e5514d9b2f2","resolution":{"observed_at":"2026-08-10T22:25:55.378312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:25:55.383235Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.383235Z"},"links":{"citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:33c9d25a99811fb7c02f86f435d9f2e82ebee4200391221ce29d884fca36c2cc","observation_id":"e4e3e470-db13-4f03-8b02-211f21f57c03","resolution":{"observed_at":"2026-08-10T22:25:55.383235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17142","last_updated":"2024-06-10T14:07:53Z","snapshot_observed_at":"2026-08-13T04:52:45.023757Z","submitted_at":"2023-12-28T17:16:44Z","title":"DreamGaussian4D: Generative 4D Gaussian Splatting","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17142","snapshot_observed_at":"2026-08-10T22:25:55.387765Z","title":"Dreamgaussian4d: Genera- tive 4d gaussian splatting","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.387765Z"},"links":{"cited_paper":"/paper/2312.17142","citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:cff163aee02bbd75f990795d55734ff8766e849ed6f487ab3ccd4d6181b66b51","observation_id":"24f68d4d-3e9d-4adf-98e3-80e016609e89","resolution":{"observed_at":"2026-08-10T22:25:55.387765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10324","last_updated":"2024-06-14T17:51:18Z","snapshot_observed_at":"2026-08-12T23:42:28.708256Z","submitted_at":"2024-06-14T17:51:18Z","title":"L4GM: Large 4D Gaussian Reconstruction Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10324","snapshot_observed_at":"2026-08-10T22:25:55.392502Z","title":"L4gm: Large 4d gaus- sian reconstruction model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.392502Z"},"links":{"cited_paper":"/paper/2406.10324","citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:1353a1be21125a72dee169e337bd5bf47a5566c50414fe93daa73e00131601b5","observation_id":"2192cef0-58a5-4c88-b22b-180ea6d7445f","resolution":{"observed_at":"2026-08-10T22:25:55.392502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:25:55.397401Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.397401Z"},"links":{"citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:3d37bec8b7b03c3c318cd7d46a2419918483bf42b65caa27599a5f663de48f50","observation_id":"c935efe5-5518-49a7-bb9b-ef5d4d9c9963","resolution":{"observed_at":"2026-08-10T22:25:55.397401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16512","last_updated":"2024-04-18T04:12:32Z","snapshot_observed_at":"2026-07-06T16:12:38.269310Z","submitted_at":"2023-08-31T07:49:06Z","title":"MVDream: Multi-view Diffusion for 3D Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16512","snapshot_observed_at":"2026-08-10T22:25:55.401702Z","title":"Mvdream: Multi-view diffusion for 3d gen- eration","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.401702Z"},"links":{"cited_paper":"/paper/2308.16512","citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:e55efa3de52bc68656b2b44d5ff9b6579fb599535f51511a2d2aa0c824fdd32b","observation_id":"9de1dca4-743b-413f-86cd-fe95a9b09178","resolution":{"observed_at":"2026-08-10T22:25:55.401702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13912","last_updated":"2024-08-27T19:06:57Z","snapshot_observed_at":"2026-08-05T11:12:55.434512Z","submitted_at":"2024-08-25T18:27:20Z","title":"Splatt3R: Zero-shot Gaussian Splatting from Uncalibrated Image Pairs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13912","snapshot_observed_at":"2026-08-10T22:25:55.406820Z","title":"Splatt3r: Zero-shot gaussian splat- ting from uncalibarated image pairs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.406820Z"},"links":{"cited_paper":"/paper/2408.13912","citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:781beccb08d67db4ae3a727d1a3c48d3ed93ece111e719c60a025008234a10fe","observation_id":"7281cb85-7659-401e-8391-ac8be9d0c6c2","resolution":{"observed_at":"2026-08-10T22:25:55.406820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18132","last_updated":"2024-05-28T12:47:22Z","snapshot_observed_at":"2026-08-12T23:56:12.444762Z","submitted_at":"2024-05-28T12:47:22Z","title":"EG4D: Explicit Generation of 4D Object without Score Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18132","snapshot_observed_at":"2026-08-10T22:25:55.411919Z","title":"Eg4d: Explicit generation of 4d object without score distil- lation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.411919Z"},"links":{"cited_paper":"/paper/2405.18132","citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:d207f3b4b83de2b8e607f43c8fca5497d9db1777b2f417f085f909f2998f954d","observation_id":"5a1971f8-bf58-4842-bbe4-af3f0fa6b885","resolution":{"observed_at":"2026-08-10T22:25:55.411919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16653","last_updated":"2024-03-29T08:39:23Z","snapshot_observed_at":"2026-07-06T16:25:05.493379Z","submitted_at":"2023-09-28T17:55:05Z","title":"DreamGaussian: Generative Gaussian Splatting for Efficient 3D Content Creation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16653","snapshot_observed_at":"2026-08-10T22:25:55.417719Z","title":"Dreamgaussian: Generative gaussian splatting for effi- cient 3d content creation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.417719Z"},"links":{"cited_paper":"/paper/2309.16653","citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:e22a46f4af6d97072abcb5fa8b7fc31f2627e936e226674c44bb628570a01463","observation_id":"c1d1395b-a8e8-4249-aa95-cedf4e89bcd4","resolution":{"observed_at":"2026-08-10T22:25:55.417719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:25:56.166283Z","title":"Lgm: Large multi-view gaussian model for high-resolution 3d content creation","venue":null,"work_id":"9f785868-15e2-452f-9d26-aec1c27a942b","year":2024},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.423990Z"},"links":{"citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:42e70ab0f826f46b8da47c508c8205011097cfed652450c76e91b3ac8b7b093d","observation_id":"c8ad3180-a0eb-4c7e-bc1f-86afecabe852","resolution":{"observed_at":"2026-08-10T22:25:56.171089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-08-11T02:30:38.877941Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-10T22:25:55.428902Z","title":"To- wards accurate generative models of video: A new metric & challenges","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.428902Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:287e484bd75446d40a717052862106c8c3c3ced330c0f6ff3988c844ac111398","observation_id":"a9d45ee2-fd62-45a9-aa07-1542e349dfd0","resolution":{"observed_at":"2026-08-10T22:25:55.428902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:25:56.150542Z","title":"Phenaki: Variable length video generation from open domain textual descriptions","venue":null,"work_id":"2ec1ef1a-f6d7-4f40-bd61-b22a37dbb6d0","year":2022},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.434719Z"},"links":{"citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:6f69baa7905dc2b0d482f5d4ec28c1af8630b8ab9113e1afb40eace7fe6ec53d","observation_id":"23314bc1-9bbb-4e2d-8f68-132c9ad853e9","resolution":{"observed_at":"2026-08-10T22:25:56.156098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:25:55.440063Z","title":"Image quality assessment: from error visibility to structural similarity","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.440063Z"},"links":{"citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:9f8b2bf425f521b87ac529481762007ca70c3bf8dbff3475eb9417863850333c","observation_id":"54b479a3-ed4b-4400-bddb-7d6fe4f4709f","resolution":{"observed_at":"2026-08-10T22:25:55.440063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:25:56.126779Z","title":"Prolificdreamer: High-fidelity and diverse text-to-3d generation with variational score distilla- tion","venue":null,"work_id":"5fc1aeb9-8b51-4464-8dc7-85dfb22bda82","year":2024},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.445048Z"},"links":{"citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:13c239edad6cc0fc3cb8d019f63ec241ff03791ac291153138dd818f655c0a58","observation_id":"1187e5f3-9da7-49a8-b0c4-483f1e089c1e","resolution":{"observed_at":"2026-08-10T22:25:56.131782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:25:55.451389Z","title":"4d gaussian splatting for real-time dynamic scene rendering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.451389Z"},"links":{"citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:add60cbfd89558c97ce6dfcb7d07fe07aa4f6dc605d17b07a58ed4369be284cf","observation_id":"67b6152b-fbec-473a-8c74-289af210672b","resolution":{"observed_at":"2026-08-10T22:25:55.451389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:25:55.456918Z","title":"Tune-a-video: One-shot tuning of image diffusion models for text-to-video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.456918Z"},"links":{"citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:5f7685f698318a383729065da42a6602ac1856446c72d6176dae57f5f4b31720","observation_id":"d134d139-da09-44ac-a72b-5cceb0a0cdf2","resolution":{"observed_at":"2026-08-10T22:25:55.456918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17470","last_updated":"2025-02-27T21:52:39Z","snapshot_observed_at":"2026-08-12T23:15:26.209419Z","submitted_at":"2024-07-24T17:59:43Z","title":"SV4D: Dynamic 3D Content Generation with Multi-Frame and Multi-View Consistency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17470","snapshot_observed_at":"2026-08-10T22:25:55.461513Z","title":"Sv4d: Dynamic 3d content generation with multi-frame and multi-view consistency","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.461513Z"},"links":{"cited_paper":"/paper/2407.17470","citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:8d1267879a0b8c3b4a9fc7f4cfe35b49726ad31f6463e51b807d77c5d28bf9c8","observation_id":"a269dc50-4099-4822-a701-bf4b8dad37ca","resolution":{"observed_at":"2026-08-10T22:25:55.461513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02509","last_updated":"2024-06-04T17:27:19Z","snapshot_observed_at":"2026-08-04T13:02:12.217544Z","submitted_at":"2024-06-04T17:27:19Z","title":"CamCo: Camera-Controllable 3D-Consistent Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02509","snapshot_observed_at":"2026-08-10T22:25:55.466525Z","title":"Camco: Camera- 10 controllable 3d-consistent image-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.466525Z"},"links":{"cited_paper":"/paper/2406.02509","citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:79c8f29547ccde3ef2296c96262782f92bee5c35be9af5193c082998d6ed633d","observation_id":"f85db101-c269-4623-9ca1-393c4d9f759e","resolution":{"observed_at":"2026-08-10T22:25:55.466525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:25:56.092127Z","title":"Deformable 3d gaussians for high- fidelity monocular dynamic scene reconstruction","venue":null,"work_id":"b41a287e-5888-4885-9498-dd5788952da1","year":2024},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.471069Z"},"links":{"citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:94650c13030cc4d05b2e0069efaf27899b42321148ff38ff53de739b4624fe5f","observation_id":"13cb0d96-84bc-49f3-bd74-1524ef211d13","resolution":{"observed_at":"2026-08-10T22:25:56.097702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02148","last_updated":"2024-10-02T14:07:04Z","snapshot_observed_at":"2026-08-13T00:39:04.598468Z","submitted_at":"2024-04-02T17:58:03Z","title":"Diffusion$^2$: Dynamic 3D Content Generation via Score Composition of Video and Multi-view Diffusion Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02148","snapshot_observed_at":"2026-08-10T22:25:55.475396Z","title":"Diffu- sion 2: Dynamic 3d content generation via score com- position of orthogonal diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.475396Z"},"links":{"cited_paper":"/paper/2404.02148","citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:a8d40e417be2220afe3f81957b051bd8db35c1ca6994a6bf1421f00692d108e6","observation_id":"2dd2a1b0-7d35-4cea-ae55-d6c32821eba2","resolution":{"observed_at":"2026-08-10T22:25:55.475396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08529","last_updated":"2024-05-13T14:12:23Z","snapshot_observed_at":"2026-08-13T05:50:26.855347Z","submitted_at":"2023-10-12T17:22:24Z","title":"GaussianDreamer: Fast Generation from Text to 3D Gaussians by Bridging 2D and 3D Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08529","snapshot_observed_at":"2026-08-10T22:25:55.479899Z","title":"Gaussian- dreamer: Fast generation from text to 3d gaussian splatting with point cloud priors","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.479899Z"},"links":{"cited_paper":"/paper/2310.08529","citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:4501aae6256643a699d601d39548351dd742a024c707b7db31a5f3876cbc0ee5","observation_id":"eaaccaba-424d-4c16-9fd8-74cc01ed5c8f","resolution":{"observed_at":"2026-08-10T22:25:55.479899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02048","last_updated":"2024-09-03T16:53:19Z","snapshot_observed_at":"2026-07-06T19:09:55.393720Z","submitted_at":"2024-09-03T16:53:19Z","title":"ViewCrafter: Taming Video Diffusion Models for High-fidelity Novel View Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02048","snapshot_observed_at":"2026-08-10T22:25:55.486085Z","title":"Viewcrafter: Taming video diffusion models for high-fidelity novel view synthesis.arXiv preprint arXiv:2409.02048, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.486085Z"},"links":{"cited_paper":"/paper/2409.02048","citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:1cd04ddccaa7a27ebefe711fa8c6019a817dcd0ed12cd1cf83ee56fc659b8932","observation_id":"04485df3-271c-43aa-a162-155642fba33a","resolution":{"observed_at":"2026-08-10T22:25:55.486085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12684","last_updated":"2024-07-17T16:02:55Z","snapshot_observed_at":"2026-08-12T23:20:13.561157Z","submitted_at":"2024-07-17T16:02:55Z","title":"4Dynamic: Text-to-4D Generation with Hybrid Priors","version":1},"cited_work":{"arxiv_id":"2407.12684","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.12684","snapshot_observed_at":"2026-08-10T22:25:55.635252Z","title":"4Dynamic: Text-to-4D Generation with Hybrid Priors","venue":"cs.CV","work_id":"a9dc89a6-8deb-4a30-be33-5948a777e877","year":2024},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.491407Z"},"links":{"cited_paper":"/paper/2407.12684","citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:1cdc53fab168ff6de48bc40d88ee805fd4cd77b31bc63a98d1b998543931cde6","observation_id":"63ef4725-28c2-42a9-9da5-84a8d58a47ae","resolution":{"observed_at":"2026-08-10T22:25:55.643470Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:25:56.079083Z","title":"Stag4d: Spatial-temporal anchored generative 4d gaussians","venue":null,"work_id":"78980ba6-1393-4483-99a6-d1f2c81b6ecd","year":2025},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.497269Z"},"links":{"citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:ea669976fcd2c803a3501ddcec53477eadd3f1e39c2d197df7b1a39992bec9ae","observation_id":"d0df6088-3290-48cc-b31b-85f4605544e9","resolution":{"observed_at":"2026-08-10T22:25:56.083486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:25:56.062898Z","title":"Show-1: Marrying pixel and latent diffusion models for text-to-video generation","venue":null,"work_id":"17c82d98-5e42-4021-b536-aa27faff97e6","year":2024},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.501958Z"},"links":{"citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:c4d0ada7900b293b2c3e2fdd1caf41fee3d344bb73618ce79395de9b478db837","observation_id":"9490a453-7b97-49d0-90ff-7c63f3374e69","resolution":{"observed_at":"2026-08-10T22:25:56.068472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20674","last_updated":"2024-10-22T08:50:16Z","snapshot_observed_at":"2026-08-12T23:53:30.964876Z","submitted_at":"2024-05-31T08:18:39Z","title":"4Diffusion: Multi-view Video Diffusion Model for 4D Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20674","snapshot_observed_at":"2026-08-10T22:25:55.508339Z","title":"4diffusion: Multi-view video diffusion model for 4d generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.508339Z"},"links":{"cited_paper":"/paper/2405.20674","citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:b5fb2f798bf9cb00c83068ba972f24577e98916f453d7a086ea1f05c7d752104","observation_id":"a531618b-919b-4f8d-8aba-73e16874d421","resolution":{"observed_at":"2026-08-10T22:25:55.508339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:25:55.513275Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.513275Z"},"links":{"citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:2274867fb59c27367fe52119880775396d69a61c334112e594d34cac5f43a60b","observation_id":"bc072b74-685f-4d30-98e7-f48cf82ac925","resolution":{"observed_at":"2026-08-10T22:25:55.513275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:25:55.518142Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.518142Z"},"links":{"citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:0cea754ba883b8b8d16e42b87481e6eef8eb5ded9f3a2b983e35279002d7a990","observation_id":"7aca5b56-31ac-4d70-a825-080940d5ee54","resolution":{"observed_at":"2026-08-10T22:25:55.518142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14603","last_updated":"2024-02-19T02:30:14Z","snapshot_observed_at":"2026-08-13T05:18:18.810557Z","submitted_at":"2023-11-24T16:47:05Z","title":"Animate124: Animating One Image to 4D Dynamic Scene","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.14603","snapshot_observed_at":"2026-08-10T22:25:55.523118Z","title":"Animate124: Animating one im- age to 4d dynamic scene","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.523118Z"},"links":{"cited_paper":"/paper/2311.14603","citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:647584cb9682317965d45a2d97cc21383e6a71dc921db1563a0514118bf70ee1","observation_id":"6c952e3c-1df4-426e-9ceb-1d83293a8fba","resolution":{"observed_at":"2026-08-10T22:25:55.523118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00558","last_updated":"2024-08-31T23:07:22Z","snapshot_observed_at":"2026-08-12T22:53:47.393142Z","submitted_at":"2024-08-31T23:07:22Z","title":"Compositional 3D-aware Video Generation with LLM Director","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00558","snapshot_observed_at":"2026-08-10T22:25:55.528521Z","title":"Compositional 3d-aware video gen- eration with llm director","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T22:25:55.528521Z"},"links":{"cited_paper":"/paper/2409.00558","citing_paper":"/paper/2501.01722"},"observation_digest":"sha256:b7711fe0b32856c19a0d15950c54047f0afb8d67c703b71bbc73d78d1527f24d","observation_id":"93ef31c7-24a3-41c7-af81-2ee5bbba9239","resolution":{"observed_at":"2026-08-10T22:25:55.528521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.01722","last_updated":"2025-01-03T09:27:36Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T01:51:17.047236Z","submitted_at":"2025-01-03T09:27:36Z","title":"AR4D: Autoregressive 4D Generation from Monocular Videos"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":3,"verified_fuzzy":15},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 4 inbound Pith citation observations for arXiv:2501.01722."}