{"as_of":"2026-08-14T22:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:190fbf4481fdde8a63ea9ee356ee3baa497e2fb56792838fdab5d8733b03de7e","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:59:00.878129Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-02T23:56:39.865433Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T11:08:03.362718Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"cited_work":{"arxiv_id":"2506.09229","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09229","snapshot_observed_at":"2026-07-03T11:08:03.362718Z","title":"arXiv preprint arXiv:2506.09229 (2025) 2, 4, 7, 8","venue":null,"work_id":"23f5a4e3-be5d-4234-823b-217c6fa1b457","year":2025},"citing_paper":{"arxiv_id":"2604.11707","last_updated":"2026-04-13T16:42:46Z","snapshot_observed_at":"2026-08-14T02:26:44.424103Z","submitted_at":"2026-04-13T16:42:46Z","title":"Representations Before Pixels: Semantics-Guided Hierarchical Video Prediction","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T16:30:53.578491Z"},"links":{"cited_paper":"/paper/2506.09229","citing_paper":"/paper/2604.11707"},"observation_digest":"sha256:e50a139561876ef5da461aaf8e86d08f149fa9a56d52908be246453adfbf33b6","observation_id":"0c581420-517e-46eb-bb5e-b46dd599550e","resolution":{"observed_at":"2026-05-11T08:45:58.546740Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"cited_work":{"arxiv_id":"2506.09229","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09229","snapshot_observed_at":"2026-07-03T11:08:03.362718Z","title":"arXiv preprint arXiv:2506.09229 (2025) 2, 4, 7, 8","venue":null,"work_id":"23f5a4e3-be5d-4234-823b-217c6fa1b457","year":2025},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T15:51:12.604102Z"},"links":{"cited_paper":"/paper/2506.09229","citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:a1d74124d92d151540eccb5da2a31031ce9a88eac2ca4189703e60be78bc6e39","observation_id":"9b9a431c-cd03-4a26-a05d-a30ccbe19679","resolution":{"observed_at":"2026-05-11T09:46:02.839422Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"cited_work":{"arxiv_id":"2506.09229","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09229","snapshot_observed_at":"2026-07-03T11:08:03.362718Z","title":"arXiv preprint arXiv:2506.09229 (2025) 2, 4, 7, 8","venue":null,"work_id":"23f5a4e3-be5d-4234-823b-217c6fa1b457","year":2025},"citing_paper":{"arxiv_id":"2605.01896","last_updated":"2026-07-01T09:31:38Z","snapshot_observed_at":"2026-07-06T23:15:01.968194Z","submitted_at":"2026-05-03T14:22:22Z","title":"Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-02T23:56:39.865433Z"},"links":{"cited_paper":"/paper/2506.09229","citing_paper":"/paper/2605.01896"},"observation_digest":"sha256:577727d4dfb9e66db6281fe0d1923314237071c4759c0a0d1baecb78f21300cb","observation_id":"e8bcbbe9-8751-4278-abd6-76fd8212487c","resolution":{"observed_at":"2026-07-02T23:57:27.892610Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"cited_work":{"arxiv_id":"2506.09229","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09229","snapshot_observed_at":"2026-07-03T11:08:03.362718Z","title":"arXiv preprint arXiv:2506.09229 (2025) 2, 4, 7, 8","venue":null,"work_id":"23f5a4e3-be5d-4234-823b-217c6fa1b457","year":2025},"citing_paper":{"arxiv_id":"2605.24962","last_updated":"2026-05-24T09:28:05Z","snapshot_observed_at":"2026-08-02T19:14:30.533296Z","submitted_at":"2026-05-24T09:28:05Z","title":"Tempered Self-Similarity Alignment for Physically Plausible Video Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T11:39:06.597513Z"},"links":{"cited_paper":"/paper/2506.09229","citing_paper":"/paper/2605.24962"},"observation_digest":"sha256:4b8cdcfa24c67fb3da55d7758cf44b0bceb08b14de55ce7c93bc52aee7e42754","observation_id":"01c8bdf5-8ded-4a4d-b33e-bcc1b905f302","resolution":{"observed_at":"2026-06-30T11:44:38.388278Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"cited_work":{"arxiv_id":"2506.09229","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09229","snapshot_observed_at":"2026-07-03T11:08:03.362718Z","title":"arXiv preprint arXiv:2506.09229 (2025) 2, 4, 7, 8","venue":null,"work_id":"23f5a4e3-be5d-4234-823b-217c6fa1b457","year":2025},"citing_paper":{"arxiv_id":"2606.12217","last_updated":"2026-06-10T15:31:25Z","snapshot_observed_at":"2026-08-13T02:16:08.998426Z","submitted_at":"2026-06-10T15:31:25Z","title":"Making Foresight Actionable: Repurposing Representation Alignment in World Action Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-27T09:40:54.963759Z"},"links":{"cited_paper":"/paper/2506.09229","citing_paper":"/paper/2606.12217"},"observation_digest":"sha256:7543d341f2ca1d238ad4cff5e86f642830dcd0af4d058956776f7c9fe71ff237","observation_id":"a4091bff-f3fe-4c4d-8b34-ebe2ff424477","resolution":{"observed_at":"2026-07-03T11:08:03.363913Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.09229/citation-record","integrity":"/paper/2506.09229/integrity","json":"/paper/2506.09229/citation-record.json","paper":"/paper/2506.09229"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03575","snapshot_observed_at":"2026-08-07T04:58:54.075933Z","title":"Agarwal, A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:54.075933Z"},"links":{"cited_paper":"/paper/2501.03575","citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:0252b7e3b3faf21d414a20af54ff20025f72f875c76b2c369d1a1a6c12176ce0","observation_id":"32cabdd5-345d-416c-ad84-abcc019dd647","resolution":{"observed_at":"2026-08-07T04:58:54.075933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:04.470221Z","title":"Baker, I","venue":null,"work_id":"a6011f1f-cfe4-4e9d-a3e4-9fb9d9c947f2","year":2022},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:54.147170Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:3e38c11f9693138aefe591b5644dcd2d75bd8b36fa280ceff4fb2a00889c8215","observation_id":"b9e20daa-daee-4be6-8256-fd27d91260e7","resolution":{"observed_at":"2026-08-07T04:59:04.547903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:04.323989Z","title":null,"venue":null,"work_id":"76c6db22-1a18-4836-8d6b-d34e486a964e","year":2025},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:54.240845Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:be664313daa5251acf463a30872108bc9744a2eee70fde970eff0cdb03bf8e0c","observation_id":"484b1eae-df14-458f-bfc8-16c603cb49cb","resolution":{"observed_at":"2026-08-07T04:59:04.393193Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:04.193904Z","title":"Scenes dataset.https://huggingface.co/datasets/bigdata-pw/scenes, 2025","venue":null,"work_id":"b96f5e7d-76bb-4bef-adb6-6fe0608a743f","year":2025},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:54.331646Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:5a329a5243f9f50a34be91521287b5ccdb7a39ac2bfb0979cc9a24472ecb6b59","observation_id":"212d2a9a-5448-41fa-9c4e-23250c39ebe9","resolution":{"observed_at":"2026-08-07T04:59:04.254765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T04:58:54.413395Z","title":"Blattmann, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:54.413395Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:21286fe695a6965a3886f16007e6e45dd4746aa8b72b26c9e73a4a38b87c18ff","observation_id":"53e1fde2-3f87-4667-beeb-46ecd2477af3","resolution":{"observed_at":"2026-08-07T04:58:54.413395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:54.475871Z","title":"Blattmann, R","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:54.475871Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:7579a1515ff130b008a1ef1376fe11236a2033a2c317cc1fc34e36c799b21383","observation_id":"82630d41-0eee-4c6e-ad39-e8e85365d390","resolution":{"observed_at":"2026-08-07T04:58:54.475871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:54.548379Z","title":"Brown, B","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:54.548379Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:f3a1cc07d9f8c51636013fe0e9520e1ab25038fb9d7ffe04de01975758dad5ed","observation_id":"acfd326d-117e-4a67-bc07-936ccbe3078c","resolution":{"observed_at":"2026-08-07T04:58:54.548379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:54.642936Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:54.642936Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:975c3f1493f9db543b3c490a49a4c4e85bda62a6ddd847b9fb86b4a227b0e951","observation_id":"82b0d012-c855-47e5-9950-e5cbf78187ef","resolution":{"observed_at":"2026-08-07T04:58:54.642936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:54.722164Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:54.722164Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:c4503c806b178650c7a8672fbd37e4d803f2090de42d36f364f984800795ff40","observation_id":"42931469-6608-4aba-a780-144f405df876","resolution":{"observed_at":"2026-08-07T04:58:54.722164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:04.006808Z","title":"Cakeify smol dataset","venue":null,"work_id":"ebb066d0-0eb8-44a3-8627-9786e287e844","year":2024},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:54.781019Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:cfe9cfd82e15c60f87ba9d5ba6938c9ce5b229b367524885f948a02a060da7c5","observation_id":"d2f99442-5670-492f-b528-85186922546f","resolution":{"observed_at":"2026-08-07T04:59:04.080717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:03.858218Z","title":"Crush smol dataset","venue":null,"work_id":"4888dbf6-5819-4543-b78c-8feb2a30f032","year":2024},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:54.858367Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:9db92ab7f25cdf7ab7cf4d5bb3856a6869eff4de9449dc414062aabd8c09de6a","observation_id":"649f0bf5-6d9b-4a95-b46a-9115e20ed2d0","resolution":{"observed_at":"2026-08-07T04:59:03.922273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:03.718594Z","title":"Squish pika dataset","venue":null,"work_id":"3e5fe1ed-e4c3-47e8-84d3-1be9aa50679b","year":2024},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:54.963160Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:7c7539d92527ea5c059496b7f7427553cfb2cf62415c6c410958521930fbba65","observation_id":"dc1f7ff7-30dc-4055-be0f-c60ea87df8aa","resolution":{"observed_at":"2026-08-07T04:59:03.773661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10589","last_updated":"2025-03-13T17:40:07Z","snapshot_observed_at":"2026-08-13T05:58:35.441148Z","submitted_at":"2025-03-13T17:40:07Z","title":"Long Context Tuning for Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10589","snapshot_observed_at":"2026-08-07T04:58:55.068782Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:55.068782Z"},"links":{"cited_paper":"/paper/2503.10589","citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:09c87dccc6c4b67f7485da2edcafdced3cd965c1bf622514239e6bba25c36523","observation_id":"b4f1e179-26a3-4a52-807d-ae4c96412b42","resolution":{"observed_at":"2026-08-07T04:58:55.068782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.10964","last_updated":"2020-05-05T22:00:44Z","snapshot_observed_at":"2026-08-14T11:20:15.686010Z","submitted_at":"2020-04-23T04:21:19Z","title":"Don't Stop Pretraining: Adapt Language Models to Domains and Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.10964","snapshot_observed_at":"2026-08-07T04:58:55.232129Z","title":"Gururangan, A","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:55.232129Z"},"links":{"cited_paper":"/paper/2004.10964","citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:64e41239404c40968774b595f62ec7cf0da069475d9d0c30dd436bd64f03eb8e","observation_id":"23d133e8-920f-4f41-ad68-41bfcba13ccb","resolution":{"observed_at":"2026-08-07T04:58:55.232129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:03.552852Z","title":null,"venue":null,"work_id":"445dcadb-7096-43b9-88cf-375d45e2b157","year":null},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:55.457490Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:6a72aef15aadf729ad94fbaa47010bc6487a2a1ecba2cad9f4c273285d602e26","observation_id":"77280d0b-4a9e-40bd-8acc-b87ddb79c0cb","resolution":{"observed_at":"2026-08-07T04:59:03.640450Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:55.691200Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:55.691200Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:8576895fe98a862358e33ed123c0f69e66aec3ae7493e3eaa087ec3aaa8a44ff","observation_id":"50a983f2-0a97-4467-8978-967f0bc78d18","resolution":{"observed_at":"2026-08-07T04:58:55.691200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-07T04:58:55.911607Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:55.911607Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:b3fbe696be1541fbbf031e7c72bbcf819154f01fc0ff6358d08e9ccb1a12b99b","observation_id":"f76c8697-c3b6-44c8-8c19-bafeb7f3a54f","resolution":{"observed_at":"2026-08-07T04:58:55.911607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:56.113423Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:56.113423Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:ffa30f79dfc5ddcca6e2e04a96aab0d123b0209bd2ed34d5f39c8a54b0a15246","observation_id":"90c07177-cd3a-4101-8641-b532ae18ea0a","resolution":{"observed_at":"2026-08-07T04:58:56.113423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13731","last_updated":"2023-06-23T18:34:30Z","snapshot_observed_at":"2026-08-14T02:39:35.898777Z","submitted_at":"2023-06-23T18:34:30Z","title":"How to Efficiently Adapt Large Segmentation Model(SAM) to Medical Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13731","snapshot_observed_at":"2026-08-07T04:58:56.274007Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:56.274007Z"},"links":{"cited_paper":"/paper/2306.13731","citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:b8154e247166081006e1465715ec3c42e4cd58859489bef35e30eee183daa552","observation_id":"814a947a-5024-480f-bbbc-f78e0c64b73d","resolution":{"observed_at":"2026-08-07T04:58:56.274007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:56.406571Z","title":"Huang, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:56.406571Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:64ac89fb80f2e07d68b73aa27fc81984e2ac163c20da25353844b3b5b497ae79","observation_id":"a2e96d83-8c85-4b3d-8c5a-4c4b26f0f309","resolution":{"observed_at":"2026-08-07T04:58:56.406571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:03.383835Z","title":null,"venue":null,"work_id":"d285ff86-4e18-45e0-a3c0-5b09a91c2e5e","year":2024},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:56.625548Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:e117b0c7cfcae9e40360eb176976b7ac7215a20ed51a35c31759227a8f9eead2","observation_id":"c4de849f-3f50-4f31-b512-d293228bc8fe","resolution":{"observed_at":"2026-08-07T04:59:03.445152Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:56.769059Z","title":"Kerbl, G","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:56.769059Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:7a0bdce251fb3197b35eea19765d04e01193037804891d44ce125a01eef5e170","observation_id":"cb381b1f-6502-4a4a-b228-d47deeba0cd3","resolution":{"observed_at":"2026-08-07T04:58:56.769059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-13T14:41:45.809481Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-07T04:58:56.895532Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:56.895532Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:2d58dcbc8723ea73f830c18fb4f1760593b334d96bf6e78677fae480706e0939","observation_id":"4cd1b8cd-4a87-4f6c-953d-79834911d265","resolution":{"observed_at":"2026-08-07T04:58:56.895532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:56.946497Z","title":"Kornblith, M","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:56.946497Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:45d396fce1940e0f82701f7ecdd4589e9a0f598e0bdd244002d1a9fa8dabeb4f","observation_id":"650cbaaa-7fc6-4ec5-bf33-a3e031ff69b2","resolution":{"observed_at":"2026-08-07T04:58:56.946497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12091","last_updated":"2025-04-26T13:48:44Z","snapshot_observed_at":"2026-08-13T22:43:20.403436Z","submitted_at":"2024-12-16T18:58:17Z","title":"Wonderland: Navigating 3D Scenes from a Single Image","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12091","snapshot_observed_at":"2026-08-07T04:58:57.092872Z","title":"Liang, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:57.092872Z"},"links":{"cited_paper":"/paper/2412.12091","citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:bad7f9d8759ea8188b84539930614a8463d3ee795c0933f969011b3124f283fa","observation_id":"d88d6dd3-420c-467a-bca7-fe1699492d03","resolution":{"observed_at":"2026-08-07T04:58:57.092872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:57.226813Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:57.226813Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:2c0ef05df9522aa4d6a5eb1fbd2c3dcb0e08e276af2b1752bf84cd53b0b98ea8","observation_id":"f9999628-37dc-41a8-858d-b6df74cf6716","resolution":{"observed_at":"2026-08-07T04:58:57.226813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:03.238276Z","title":null,"venue":null,"work_id":"13dfc50f-9ee0-4524-a5dd-25024ee7886c","year":2024},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:57.378218Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:48dff08cd55d5eb475aa2a3a7098b16af9a9b2a80596e6e876ecdffe948b57e0","observation_id":"948327a2-94cf-4e92-91a0-12147e52608b","resolution":{"observed_at":"2026-08-07T04:59:03.303275Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:57.624050Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:57.624050Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:4be01ef30627b635fdff2c46c31c469f2d7f31ddd0fb9a664f6564c4a161a483","observation_id":"79a89b01-c357-4afc-90d1-a9c17c84c86d","resolution":{"observed_at":"2026-08-07T04:58:57.624050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:03.094860Z","title":null,"venue":null,"work_id":"4ae521f8-4a82-4f8d-b18e-9362bd723daa","year":2024},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:57.806559Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:b596833509964b9fea0c28f4fa2971d33b3caafc59e1360d0e74ba0db5584952","observation_id":"2861068b-d4e5-4de7-83a3-17defcf5ec11","resolution":{"observed_at":"2026-08-07T04:59:03.158274Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07746","last_updated":"2024-12-10T18:45:04Z","snapshot_observed_at":"2026-08-14T08:53:30.846168Z","submitted_at":"2024-12-10T18:45:04Z","title":"LoRA3D: Low-Rank Self-Calibration of 3D Geometric Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07746","snapshot_observed_at":"2026-08-07T04:58:57.941066Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:57.941066Z"},"links":{"cited_paper":"/paper/2412.07746","citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:0a04d42a97895acf2b76ddfb70d65e7688f91d6217627b85b80409801fc71ecb","observation_id":"34e8cc7b-84cc-4e46-9428-ba9a762804f3","resolution":{"observed_at":"2026-08-07T04:58:57.941066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:02.964190Z","title":null,"venue":null,"work_id":"15803b23-cba5-4bb2-a681-feeffffe75a0","year":2024},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:58.092897Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:e6bd4d8766abf9495fd0a68a7f17b966c72dbef90c3ca15e95a3f8e909a49d81","observation_id":"2a21b18b-2e71-46bf-ac81-e24fc942ab43","resolution":{"observed_at":"2026-08-07T04:59:03.023638Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:02.846562Z","title":"Mahendran and A","venue":null,"work_id":"82cbaddf-d89b-408e-b5fd-2fffeb31a60f","year":2015},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:58.190029Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:47e1be1f5298780423064f977a60ed1298d1847b287459e8752226135b5a6622","observation_id":"f47a902a-a281-45d0-9412-ef8ec2499fa4","resolution":{"observed_at":"2026-08-07T04:59:02.888084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:02.705623Z","title":"Oquab, T","venue":null,"work_id":"dd6c3240-ef15-4f72-aa75-7f7b2e529c21","year":null},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:58.326772Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:51af35b7305ec9cbdaaef4a2b9848ce5b5119d55d6392d04672913627b0a4a54","observation_id":"be8bc8ef-9ca7-4ffd-a473-154bc18b4658","resolution":{"observed_at":"2026-08-07T04:59:02.761707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:58.423770Z","title":"Peebles and S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:58.423770Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:c9d036782e084af92a0bc7246ba03fbdc6aef427654f839bf1c7ad31d882711c","observation_id":"527b7160-ebef-46e0-b097-c51c3210dd7c","resolution":{"observed_at":"2026-08-07T04:58:58.423770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:58.550560Z","title":null,"venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:58.550560Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:225290aca544526f68e91606a04cf5fb4cfeb3642727e11961444f6ad79e73e1","observation_id":"28803efb-76e8-4332-a6d4-d2337ab15f35","resolution":{"observed_at":"2026-08-07T04:58:58.550560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:02.510897Z","title":null,"venue":null,"work_id":"d00b11da-0a39-4126-b7f2-88cece3c0a0b","year":2023},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:58.647520Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:7be177c9e3922f7fd275e6ed39650897b53443311b8c3bd23699eee9304086f2","observation_id":"2b114bc8-d6bf-4dd7-84b6-09c9a796cff2","resolution":{"observed_at":"2026-08-07T04:59:02.606531Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:02.377278Z","title":null,"venue":null,"work_id":"4ef74dfd-994a-4b8c-adc9-30656ea9807e","year":2016},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:58.788656Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:2150ccb99963bbd0abe1c803455febb30c203e56631d39840b177451d948112a","observation_id":"ca972199-9970-43bc-a138-abe2203e1904","resolution":{"observed_at":"2026-08-07T04:59:02.433471Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:02.252297Z","title":null,"venue":null,"work_id":"a0805bf0-314f-420d-8422-241d2860b154","year":2024},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:58.925893Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:033495c70f49f574a1675401828da49119e4b996295f1faac0d242e03d8ea82f","observation_id":"fa87bace-6e62-4c44-9dba-cd9769ae9f8d","resolution":{"observed_at":"2026-08-07T04:59:02.314036Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:58:58.999429Z","title":"Sohl-Dickstein, E","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:58.999429Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:50bf38b0486fddc3aa548968ef22457eac83afcfd7b5b0ce929ee6c19107f011","observation_id":"7a83ecd2-f632-46bb-b42b-6c2076c64569","resolution":{"observed_at":"2026-08-07T04:58:58.999429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-07T04:58:59.134015Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:59.134015Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:dbf9d6bba9fbf18d328002d50c039c07d354ca3a0d770139a50380126923548c","observation_id":"c9a00406-d5f2-4675-bcb9-ec4c402ed411","resolution":{"observed_at":"2026-08-07T04:58:59.134015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-07T04:58:59.265853Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:59.265853Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:7850933c0743667d6ef9b8fde74ce242fc35a2a3d2fb527f756bca1c51d0d15c","observation_id":"20bfeda4-0466-4e40-8923-eeb37a2c6abc","resolution":{"observed_at":"2026-08-07T04:58:59.265853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-08-12T22:34:51.361078Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-07T04:58:59.392779Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:59.392779Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:7af4d225e91a97ed29df073f073a6cca56606d4dadc312e751b7da4cb0e32a45","observation_id":"9de21364-8d91-4d7e-b1b0-be0ec841ca9b","resolution":{"observed_at":"2026-08-07T04:58:59.392779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:02.075959Z","title":null,"venue":null,"work_id":"dbd08a90-7b96-42ee-b7ad-67aeee732034","year":2024},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:59.552589Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:db30be9df6d6f8a25e79b692b7af62953147a43445ed41f887e2be33fa7d30d2","observation_id":"7a6c2743-04ff-4c9a-b596-8b86fc65adfb","resolution":{"observed_at":"2026-08-07T04:59:02.142489Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:01.957844Z","title":null,"venue":null,"work_id":"ade4d828-a95d-489d-afba-69a6b0a49239","year":2023},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:59.675013Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:8dce4ab3f7b60975a452749cc7854be08dbeec463b352d1d9f69d61ee4128848","observation_id":"68824346-05e2-4fcd-8d76-8c9e55b44672","resolution":{"observed_at":"2026-08-07T04:59:02.012157Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:01.828699Z","title":"Disney video generation dataset","venue":null,"work_id":"50ccbb50-037d-43c9-8d29-da2e59943464","year":2024},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:59.780924Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:184bd9ed2af10f0226a60515b02faf70aad78cddaef0b801fe097484aa397c03","observation_id":"1fce435d-6b28-43ea-9bc9-27d8f14af809","resolution":{"observed_at":"2026-08-07T04:59:01.900089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:01.718510Z","title":"Tom and jerry video generation dataset","venue":null,"work_id":"a5e7d3db-42c1-43bb-a30a-23a5195eb6de","year":2024},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T04:58:59.950113Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:9145fcd29c3088ff29732bc6752808fdd84ea38b1ec20f8069df8d17993c1dc7","observation_id":"0e4e0981-9d19-4072-b796-9033393f27df","resolution":{"observed_at":"2026-08-07T04:59:01.770396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:01.579137Z","title":"Xiang, H","venue":null,"work_id":"61d6ac4e-d932-41c2-be41-21e934edadcd","year":2023},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T04:59:00.081997Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:5029fede4a3a2720540d5d459a3fd952c3e03a15d2748fecab96260825088b21","observation_id":"5b90e42e-be20-4fd7-9174-67555a3f6b0d","resolution":{"observed_at":"2026-08-07T04:59:01.644663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:01.479128Z","title":null,"venue":null,"work_id":"75fd6236-fda2-4fc1-be33-45bbe1e2ac4f","year":2024},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T04:59:00.309419Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:8d6315bf6f9ecf16c7518b2573a892b80f1fc017837159126401b368acf4fbbc","observation_id":"584051e3-5bcf-4549-af5c-fa5966d48ab5","resolution":{"observed_at":"2026-08-07T04:59:01.537258Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:01.378798Z","title":null,"venue":null,"work_id":"84be4be3-281f-47c5-a49e-2fd120423f3b","year":2022},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T04:59:00.471626Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:aeba5f18d4b8736a5d581e6866a7ac551ef63254cf9603bdaf48e7fd7aa0d766","observation_id":"4265131c-7609-47fe-860d-62cc9724cbc4","resolution":{"observed_at":"2026-08-07T04:59:01.429395Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06940","last_updated":"2025-06-18T04:35:42Z","snapshot_observed_at":"2026-07-06T19:30:26.233621Z","submitted_at":"2024-10-09T14:34:53Z","title":"Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06940","snapshot_observed_at":"2026-08-07T04:59:00.595140Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T04:59:00.595140Z"},"links":{"cited_paper":"/paper/2410.06940","citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:f5e5f964855e8aeced6cd347e3169bb8cada4b7b03111ce99bed12aeac03c64e","observation_id":"bf9ad171-3aaa-49af-939f-bd57ef2b24f4","resolution":{"observed_at":"2026-08-07T04:59:00.595140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:59:01.228202Z","title":null,"venue":null,"work_id":"96834c7c-3388-4ca6-9fec-1f0d278f0d18","year":2024},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T04:59:00.736880Z"},"links":{"citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:23c89e977afb3d035be162d4094a3740e35662e22b4ec59b90e4fbbd32459475","observation_id":"1e6db635-0be2-4ab5-9fc0-9b3f8bd28ef0","resolution":{"observed_at":"2026-08-07T04:59:01.316779Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20404","last_updated":"2024-12-29T08:52:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-29T08:52:49Z","title":"Open-Sora: Democratizing Efficient Video Production for All","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20404","snapshot_observed_at":"2026-08-07T04:59:00.878129Z","title":"Zheng, X","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T04:59:00.878129Z"},"links":{"cited_paper":"/paper/2412.20404","citing_paper":"/paper/2506.09229"},"observation_digest":"sha256:dec81dda64f0dec98a45d97b966b3c0b89c06823abe90050421cf5beaed74a93","observation_id":"d3923465-b429-4008-909c-96c613a3f77f","resolution":{"observed_at":"2026-08-07T04:59:00.878129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.09229","last_updated":"2025-06-25T15:46:16Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T20:47:12.825091Z","submitted_at":"2025-06-10T20:34:47Z","title":"Cross-Frame Representation Alignment for Fine-Tuning Video Diffusion Models"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 5 inbound Pith citation observations for arXiv:2506.09229."}