{"as_of":"2026-08-16T22:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3e1d05b0d511e9b41ed5afdc9bad8a7b90ad0291df3536f416187085652c94fb","coverage":[{"denominator":19,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T23:05:27.453564Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:07:18.202024Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T05:56:40.931162Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.15220","last_updated":"2024-12-03T21:48:08Z","snapshot_observed_at":"2026-08-14T05:21:49.294095Z","submitted_at":"2024-12-03T21:48:08Z","title":"SyncFlow: Toward Temporally Aligned Joint Audio-Video Generation from Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15220","snapshot_observed_at":"2026-08-05T00:05:47.713763Z","title":"Syncflow: Toward temporally aligned joint audio-video generation from text.arXiv preprint arXiv:2412.15220, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06155","last_updated":"2025-09-07T17:55:03Z","snapshot_observed_at":"2026-08-14T19:01:16.242136Z","submitted_at":"2025-09-07T17:55:03Z","title":"UniVerse-1: Unified Audio-Video Generation via Stitching of Experts","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T00:05:47.713763Z"},"links":{"cited_paper":"/paper/2412.15220","citing_paper":"/paper/2509.06155"},"observation_digest":"sha256:00705d0d818ea4316aa3660228d9420bc19f8609a7d3b7a904549fe25cb0cfd5","observation_id":"dea83d22-1d9d-49da-ac40-e2eabc4cca0e","resolution":{"observed_at":"2026-08-05T00:05:47.713763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15220","last_updated":"2024-12-03T21:48:08Z","snapshot_observed_at":"2026-08-14T05:21:49.294095Z","submitted_at":"2024-12-03T21:48:08Z","title":"SyncFlow: Toward Temporally Aligned Joint Audio-Video Generation from Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15220","snapshot_observed_at":"2026-08-04T12:38:58.383496Z","title":"Syncflow: Toward temporally aligned joint audio-video generation from text.arXiv preprint arXiv:2412.15220, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03117","last_updated":"2026-06-26T03:58:11Z","snapshot_observed_at":"2026-08-15T08:25:50.217162Z","submitted_at":"2025-10-03T15:43:56Z","title":"Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T12:38:58.383496Z"},"links":{"cited_paper":"/paper/2412.15220","citing_paper":"/paper/2510.03117"},"observation_digest":"sha256:497cbe38f28639b429beeddfea3079d118431f915f9f1dd48c7cda2ff8e6ca51","observation_id":"42b6baa9-358b-4bba-97f5-d90724595e5d","resolution":{"observed_at":"2026-08-04T12:38:58.383496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15220","last_updated":"2024-12-03T21:48:08Z","snapshot_observed_at":"2026-08-14T05:21:49.294095Z","submitted_at":"2024-12-03T21:48:08Z","title":"SyncFlow: Toward Temporally Aligned Joint Audio-Video Generation from Text","version":1},"cited_work":{"arxiv_id":"2412.15220","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15220","snapshot_observed_at":"2026-07-02T05:56:40.931162Z","title":"SyncFlow: Toward temporally aligned joint audio-video generation from text","venue":null,"work_id":"8f91b70c-6c86-488d-8a17-9f6a5a12f29d","year":2024},"citing_paper":{"arxiv_id":"2512.13281","last_updated":"2026-05-07T09:33:52Z","snapshot_observed_at":"2026-08-13T09:58:32.320290Z","submitted_at":"2025-12-15T12:41:23Z","title":"VideoASMR-Bench: Can AI-Generated ASMR Videos Fool VLMs and Humans?","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-16T21:46:43.353305Z"},"links":{"cited_paper":"/paper/2412.15220","citing_paper":"/paper/2512.13281"},"observation_digest":"sha256:f50c4c09d42382d22c9ee8efb9631b1ba544319ad18bed1bfb2c063c99b28fc2","observation_id":"d7a23a1c-972f-4725-8ad4-3706843219ac","resolution":{"observed_at":"2026-05-16T21:48:34.544967Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15220","last_updated":"2024-12-03T21:48:08Z","snapshot_observed_at":"2026-08-14T05:21:49.294095Z","submitted_at":"2024-12-03T21:48:08Z","title":"SyncFlow: Toward Temporally Aligned Joint Audio-Video Generation from Text","version":1},"cited_work":{"arxiv_id":"2412.15220","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15220","snapshot_observed_at":"2026-07-02T05:56:40.931162Z","title":"SyncFlow: Toward temporally aligned joint audio-video generation from text","venue":null,"work_id":"8f91b70c-6c86-488d-8a17-9f6a5a12f29d","year":2024},"citing_paper":{"arxiv_id":"2512.23994","last_updated":"2026-05-18T09:30:21Z","snapshot_observed_at":"2026-08-11T05:36:46.515417Z","submitted_at":"2025-12-30T05:22:31Z","title":"PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T19:43:37.604351Z"},"links":{"cited_paper":"/paper/2412.15220","citing_paper":"/paper/2512.23994"},"observation_digest":"sha256:5de54dcfc8cf076aad43e6f536cf730e12198204be43cbe5623e35c1a8a37ea4","observation_id":"cfb1d7bd-7733-41fe-aa49-4ab177adeeae","resolution":{"observed_at":"2026-05-16T19:48:21.933593Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15220","last_updated":"2024-12-03T21:48:08Z","snapshot_observed_at":"2026-08-14T05:21:49.294095Z","submitted_at":"2024-12-03T21:48:08Z","title":"SyncFlow: Toward Temporally Aligned Joint Audio-Video Generation from Text","version":1},"cited_work":{"arxiv_id":"2412.15220","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15220","snapshot_observed_at":"2026-07-02T05:56:40.931162Z","title":"SyncFlow: Toward temporally aligned joint audio-video generation from text","venue":null,"work_id":"8f91b70c-6c86-488d-8a17-9f6a5a12f29d","year":2024},"citing_paper":{"arxiv_id":"2512.23994","last_updated":"2026-05-18T09:30:21Z","snapshot_observed_at":"2026-08-11T05:36:46.515417Z","submitted_at":"2025-12-30T05:22:31Z","title":"PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-21T16:10:31.015783Z"},"links":{"cited_paper":"/paper/2412.15220","citing_paper":"/paper/2512.23994"},"observation_digest":"sha256:8344517bfada49a52b2150b204e424ba79c3e406c206208cc60f3bc4df154f16","observation_id":"2d635f72-789b-474c-9e74-2db868550dc6","resolution":{"observed_at":"2026-05-21T16:14:15.274194Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15220","last_updated":"2024-12-03T21:48:08Z","snapshot_observed_at":"2026-08-14T05:21:49.294095Z","submitted_at":"2024-12-03T21:48:08Z","title":"SyncFlow: Toward Temporally Aligned Joint Audio-Video Generation from Text","version":1},"cited_work":{"arxiv_id":"2412.15220","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15220","snapshot_observed_at":"2026-07-02T05:56:40.931162Z","title":"SyncFlow: Toward temporally aligned joint audio-video generation from text","venue":null,"work_id":"8f91b70c-6c86-488d-8a17-9f6a5a12f29d","year":2024},"citing_paper":{"arxiv_id":"2604.23586","last_updated":"2026-08-04T09:15:37Z","snapshot_observed_at":"2026-08-13T18:14:51.917658Z","submitted_at":"2026-04-26T07:48:47Z","title":"Talker-T2AV: Joint Talking Audio-Video Generation with Autoregressive Diffusion Modeling","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-08T06:44:36.000353Z"},"links":{"cited_paper":"/paper/2412.15220","citing_paper":"/paper/2604.23586"},"observation_digest":"sha256:c6d6d25dbc41db4894fcf26a2e6f4378dd9d58f734806b471a3c645f87ff80e3","observation_id":"e0f11733-31b9-4529-adee-38832a8e15ee","resolution":{"observed_at":"2026-05-11T21:06:14.373792Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15220","last_updated":"2024-12-03T21:48:08Z","snapshot_observed_at":"2026-08-14T05:21:49.294095Z","submitted_at":"2024-12-03T21:48:08Z","title":"SyncFlow: Toward Temporally Aligned Joint Audio-Video Generation from Text","version":1},"cited_work":{"arxiv_id":"2412.15220","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15220","snapshot_observed_at":"2026-07-02T05:56:40.931162Z","title":"SyncFlow: Toward temporally aligned joint audio-video generation from text","venue":null,"work_id":"8f91b70c-6c86-488d-8a17-9f6a5a12f29d","year":2024},"citing_paper":{"arxiv_id":"2605.08729","last_updated":"2026-06-29T11:45:55Z","snapshot_observed_at":"2026-08-12T18:43:13.847795Z","submitted_at":"2026-05-09T06:32:54Z","title":"Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-12T02:28:14.734682Z"},"links":{"cited_paper":"/paper/2412.15220","citing_paper":"/paper/2605.08729"},"observation_digest":"sha256:de06ea606b4d5fafbe5525ba67c864868f22dae914c987ccb1ccd92701500dd4","observation_id":"1574171a-d19c-4fb8-a268-7320017c7ec7","resolution":{"observed_at":"2026-05-12T07:36:45.368384Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15220","last_updated":"2024-12-03T21:48:08Z","snapshot_observed_at":"2026-08-14T05:21:49.294095Z","submitted_at":"2024-12-03T21:48:08Z","title":"SyncFlow: Toward Temporally Aligned Joint Audio-Video Generation from Text","version":1},"cited_work":{"arxiv_id":"2412.15220","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15220","snapshot_observed_at":"2026-07-02T05:56:40.931162Z","title":"SyncFlow: Toward temporally aligned joint audio-video generation from text","venue":null,"work_id":"8f91b70c-6c86-488d-8a17-9f6a5a12f29d","year":2024},"citing_paper":{"arxiv_id":"2605.08729","last_updated":"2026-06-29T11:45:55Z","snapshot_observed_at":"2026-08-12T18:43:13.847795Z","submitted_at":"2026-05-09T06:32:54Z","title":"Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T23:26:46.077894Z"},"links":{"cited_paper":"/paper/2412.15220","citing_paper":"/paper/2605.08729"},"observation_digest":"sha256:b23b847b3034b232b7a0e11bf5b8bc82ae8a86c764926e904a4e47f86774c7c3","observation_id":"f4d24b73-9292-4f2d-87f7-8cf8abc57f52","resolution":{"observed_at":"2026-06-30T23:35:07.852450Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15220","last_updated":"2024-12-03T21:48:08Z","snapshot_observed_at":"2026-08-14T05:21:49.294095Z","submitted_at":"2024-12-03T21:48:08Z","title":"SyncFlow: Toward Temporally Aligned Joint Audio-Video Generation from Text","version":1},"cited_work":{"arxiv_id":"2412.15220","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15220","snapshot_observed_at":"2026-07-02T05:56:40.931162Z","title":"SyncFlow: Toward temporally aligned joint audio-video generation from text","venue":null,"work_id":"8f91b70c-6c86-488d-8a17-9f6a5a12f29d","year":2024},"citing_paper":{"arxiv_id":"2606.03183","last_updated":"2026-06-02T05:41:41Z","snapshot_observed_at":"2026-07-06T23:43:27.226603Z","submitted_at":"2026-06-02T05:41:41Z","title":"Inference-Time Scaling for Joint Audio-Video Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T07:49:20.194990Z"},"links":{"cited_paper":"/paper/2412.15220","citing_paper":"/paper/2606.03183"},"observation_digest":"sha256:7f57fe026c3b3285c78ce7ab2c68c0cfbce87d3dfb4557ba6e457ab7f746908f","observation_id":"01c6ea4a-f099-458b-8219-85773421ecd2","resolution":{"observed_at":"2026-07-02T05:56:40.932702Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15220","last_updated":"2024-12-03T21:48:08Z","snapshot_observed_at":"2026-08-14T05:21:49.294095Z","submitted_at":"2024-12-03T21:48:08Z","title":"SyncFlow: Toward Temporally Aligned Joint Audio-Video Generation from Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15220","snapshot_observed_at":"2026-08-15T15:07:18.202024Z","title":"and Shi, Yangyang and Chandra, Vikas , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02035","last_updated":"2026-08-03T10:31:30Z","snapshot_observed_at":"2026-08-15T15:00:15.835016Z","submitted_at":"2026-08-03T10:31:30Z","title":"AcoustiTrace: When Plausible Sound Violates Physics","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T15:07:18.202024Z"},"links":{"cited_paper":"/paper/2412.15220","citing_paper":"/paper/2608.02035"},"observation_digest":"sha256:8048e96841267cbb4ee52bd4e354885db3e5f56d5e61fe618e89782dab789770","observation_id":"00a524b9-2b2f-4888-88d2-c28c0e276ec6","resolution":{"observed_at":"2026-08-15T15:07:18.202024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.15220/citation-record","integrity":"/paper/2412.15220/integrity","json":"/paper/2412.15220/citation-record.json","paper":"/paper/2412.15220"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-08-14T02:16:19.922733Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-08-11T23:05:27.368260Z","title":"MusicLM: Generating music from text","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15220","last_updated":"2024-12-03T21:48:08Z","snapshot_observed_at":"2026-08-14T05:21:49.294095Z","submitted_at":"2024-12-03T21:48:08Z","title":"SyncFlow: Toward Temporally Aligned Joint Audio-Video Generation from Text","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T23:05:27.368260Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2412.15220"},"observation_digest":"sha256:cf9773be68cde5ea6063833930ea7c2608af8043629597347862ef061b814a54","observation_id":"d715897c-cb03-4450-84b5-333207ec8dfa","resolution":{"observed_at":"2026-08-11T23:05:27.368260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-11T23:05:27.393605Z","title":"Imagen video: High definition video generation with diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15220","last_updated":"2024-12-03T21:48:08Z","snapshot_observed_at":"2026-08-14T05:21:49.294095Z","submitted_at":"2024-12-03T21:48:08Z","title":"SyncFlow: Toward Temporally Aligned Joint Audio-Video Generation from Text","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T23:05:27.393605Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2412.15220"},"observation_digest":"sha256:977dc3a4dcf0cf3455a2b52155065a7fc36aaa89c1671a7c30652d6494878698","observation_id":"abb54f07-cb9b-4d0f-aa35-d6e128898036","resolution":{"observed_at":"2026-08-11T23:05:27.393605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18474","last_updated":"2023-05-29T10:41:28Z","snapshot_observed_at":"2026-08-16T15:28:43.775568Z","submitted_at":"2023-05-29T10:41:28Z","title":"Make-An-Audio 2: Temporal-Enhanced Text-to-Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18474","snapshot_observed_at":"2026-08-11T23:05:27.398861Z","title":"Make-An-Audio 2: Temporal-enhanced text-to-audio generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15220","last_updated":"2024-12-03T21:48:08Z","snapshot_observed_at":"2026-08-14T05:21:49.294095Z","submitted_at":"2024-12-03T21:48:08Z","title":"SyncFlow: Toward Temporally Aligned Joint Audio-Video Generation from Text","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T23:05:27.398861Z"},"links":{"cited_paper":"/paper/2305.18474","citing_paper":"/paper/2412.15220"},"observation_digest":"sha256:26e71262c68321692d60bddd952e8c42181b1656789a8000ce4eca19a4c76e70","observation_id":"f5540ced-a70e-4c15-89a0-b2b79ce3f1d9","resolution":{"observed_at":"2026-08-11T23:05:27.398861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10537","last_updated":"2023-09-19T11:33:43Z","snapshot_observed_at":"2026-08-16T14:59:28.306895Z","submitted_at":"2023-09-19T11:33:43Z","title":"FoleyGen: Visually-Guided Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10537","snapshot_observed_at":"2026-08-11T23:05:27.408048Z","title":"Foleygen: Visually-guided audio generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15220","last_updated":"2024-12-03T21:48:08Z","snapshot_observed_at":"2026-08-14T05:21:49.294095Z","submitted_at":"2024-12-03T21:48:08Z","title":"SyncFlow: Toward Temporally Aligned Joint Audio-Video Generation from Text","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T23:05:27.408048Z"},"links":{"cited_paper":"/paper/2309.10537","citing_paper":"/paper/2412.15220"},"observation_digest":"sha256:771eba3549638b69dc4dc17575fe9366c4b29585fe8cd2c8881ecd16d6e5d443","observation_id":"a294bb5e-6dbd-4118-9daa-0d89e0471be6","resolution":{"observed_at":"2026-08-11T23:05:27.408048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07938","last_updated":"2024-03-08T22:27:38Z","snapshot_observed_at":"2026-08-16T14:11:28.782356Z","submitted_at":"2024-03-08T22:27:38Z","title":"Text-to-Audio Generation Synchronized with Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07938","snapshot_observed_at":"2026-08-11T23:05:27.412504Z","title":"Text-to-audio generation synchronized with videos","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15220","last_updated":"2024-12-03T21:48:08Z","snapshot_observed_at":"2026-08-14T05:21:49.294095Z","submitted_at":"2024-12-03T21:48:08Z","title":"SyncFlow: Toward Temporally Aligned Joint Audio-Video Generation from Text","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T23:05:27.412504Z"},"links":{"cited_paper":"/paper/2403.07938","citing_paper":"/paper/2412.15220"},"observation_digest":"sha256:e8d359f2374ac9e3a0e6e7a73267c5c85d8e0c9bf11aa84bb3427e42f62f1cc5","observation_id":"0d3da6c7-1d27-4941-8bd5-a2b01f48b431","resolution":{"observed_at":"2026-08-11T23:05:27.412504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-08-15T12:50:58.405488Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-11T23:05:27.421876Z","title":"Ramesh, P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15220","last_updated":"2024-12-03T21:48:08Z","snapshot_observed_at":"2026-08-14T05:21:49.294095Z","submitted_at":"2024-12-03T21:48:08Z","title":"SyncFlow: Toward Temporally Aligned Joint Audio-Video Generation from Text","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T23:05:27.421876Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2412.15220"},"observation_digest":"sha256:1f90d189b3126159952181212fa8e22ac1534b1c57973c21172a8e0c9e2682af","observation_id":"e45ea5c1-09fa-4992-a19d-e2928f636e11","resolution":{"observed_at":"2026-08-11T23:05:27.421876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-11T23:05:27.426158Z","title":"Make-a-Video: Text-to-video generation without text-video data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15220","last_updated":"2024-12-03T21:48:08Z","snapshot_observed_at":"2026-08-14T05:21:49.294095Z","submitted_at":"2024-12-03T21:48:08Z","title":"SyncFlow: Toward Temporally Aligned Joint Audio-Video Generation from Text","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T23:05:27.426158Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2412.15220"},"observation_digest":"sha256:a3e0eaf4b24eea12bb0fcc784df768e4f2879e8121a26aeab9a77bde92e24f7a","observation_id":"ca96df05-847d-4ac9-b96a-5c33e1c50ce4","resolution":{"observed_at":"2026-08-11T23:05:27.426158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.04421","last_updated":"2022-05-10T15:25:20Z","snapshot_observed_at":"2026-08-16T17:01:34.562034Z","submitted_at":"2022-05-09T16:57:35Z","title":"NaturalSpeech: End-to-End Text to Speech Synthesis with Human-Level Quality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.04421","snapshot_observed_at":"2026-08-11T23:05:27.430832Z","title":"NaturalSpeech: End-to-end text to speech synthesis with human-level quality","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15220","last_updated":"2024-12-03T21:48:08Z","snapshot_observed_at":"2026-08-14T05:21:49.294095Z","submitted_at":"2024-12-03T21:48:08Z","title":"SyncFlow: Toward Temporally Aligned Joint Audio-Video Generation from Text","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T23:05:27.430832Z"},"links":{"cited_paper":"/paper/2205.04421","citing_paper":"/paper/2412.15220"},"observation_digest":"sha256:06a0b40bb962d0c1ca973c6546cad7360f904880acb32680d620b8eaa027f701","observation_id":"513b7a70-aa2e-4386-9097-a4c11b164d9a","resolution":{"observed_at":"2026-08-11T23:05:27.430832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14837","last_updated":"2025-04-24T03:03:57Z","snapshot_observed_at":"2026-08-14T07:06:06.462400Z","submitted_at":"2024-08-27T07:46:07Z","title":"Diffusion Models Are Real-Time Game Engines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14837","snapshot_observed_at":"2026-08-11T23:05:27.435257Z","title":"Dani Valevski, Yaniv Leviathan, Moab Arar, and Shlomi Fruchter","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15220","last_updated":"2024-12-03T21:48:08Z","snapshot_observed_at":"2026-08-14T05:21:49.294095Z","submitted_at":"2024-12-03T21:48:08Z","title":"SyncFlow: Toward Temporally Aligned Joint Audio-Video Generation from Text","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T23:05:27.435257Z"},"links":{"cited_paper":"/paper/2408.14837","citing_paper":"/paper/2412.15220"},"observation_digest":"sha256:cb6b2b3e2e9968e61733bc42f603ff72fc3ab06b380a17c0633b628fd8415a3b","observation_id":"187f45ca-e2c5-4f3d-ad1f-92ef1785f6a7","resolution":{"observed_at":"2026-08-11T23:05:27.435257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-16T14:31:42.162436Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-11T23:05:27.439825Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15220","last_updated":"2024-12-03T21:48:08Z","snapshot_observed_at":"2026-08-14T05:21:49.294095Z","submitted_at":"2024-12-03T21:48:08Z","title":"SyncFlow: Toward Temporally Aligned Joint Audio-Video Generation from Text","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T23:05:27.439825Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2412.15220"},"observation_digest":"sha256:685c4d620c04f805180b10c09542b4f40191c8fe8ca02251e97ea0a753786f77","observation_id":"16951b98-ed79-4e0b-884f-4bed32300366","resolution":{"observed_at":"2026-08-11T23:05:27.439825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07686","last_updated":"2024-06-11T20:05:58Z","snapshot_observed_at":"2026-08-16T13:44:00.602657Z","submitted_at":"2024-06-11T20:05:58Z","title":"AV-DiT: Efficient Audio-Visual Diffusion Transformer for Joint Audio and Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07686","snapshot_observed_at":"2026-08-11T23:05:27.444425Z","title":"A V-DiT: Efficient audio- visual diffusion transformer for joint audio and video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15220","last_updated":"2024-12-03T21:48:08Z","snapshot_observed_at":"2026-08-14T05:21:49.294095Z","submitted_at":"2024-12-03T21:48:08Z","title":"SyncFlow: Toward Temporally Aligned Joint Audio-Video Generation from Text","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T23:05:27.444425Z"},"links":{"cited_paper":"/paper/2406.07686","citing_paper":"/paper/2412.15220"},"observation_digest":"sha256:a3c6b58c28d51a917443be70299d911bf0636b96db13b143a7c94b743e22f856","observation_id":"1398e0fc-7d6e-480d-9766-a9ac6e4bbea7","resolution":{"observed_at":"2026-08-11T23:05:27.444425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-08-15T19:52:28.153954Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-11T23:05:27.448864Z","title":"CogVideoX: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15220","last_updated":"2024-12-03T21:48:08Z","snapshot_observed_at":"2026-08-14T05:21:49.294095Z","submitted_at":"2024-12-03T21:48:08Z","title":"SyncFlow: Toward Temporally Aligned Joint Audio-Video Generation from Text","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T23:05:27.448864Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2412.15220"},"observation_digest":"sha256:798ac8b9744f4201167cb97312864c07502302259041485151fc3fa8f30cb74a","observation_id":"1b4b0a64-75a7-4fc7-b916-7aa38610716d","resolution":{"observed_at":"2026-08-11T23:05:27.448864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.07614","last_updated":"2025-01-09T15:48:23Z","snapshot_observed_at":"2026-08-16T13:19:19.758378Z","submitted_at":"2024-09-11T20:54:23Z","title":"FlowSep: Language-Queried Sound Separation with Rectified Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.07614","snapshot_observed_at":"2026-08-11T23:05:27.453564Z","title":"FlowSep: Language-queried sound separation with rectified flow matching","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15220","last_updated":"2024-12-03T21:48:08Z","snapshot_observed_at":"2026-08-14T05:21:49.294095Z","submitted_at":"2024-12-03T21:48:08Z","title":"SyncFlow: Toward Temporally Aligned Joint Audio-Video Generation from Text","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T23:05:27.453564Z"},"links":{"cited_paper":"/paper/2409.07614","citing_paper":"/paper/2412.15220"},"observation_digest":"sha256:d8b4481a9d9118ab3db9d45d769e00ef91e91fa10a64f174648c16f5ac68946d","observation_id":"de8052fc-ceeb-4a62-a3fc-39411cc372b1","resolution":{"observed_at":"2026-08-11T23:05:27.453564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16305","last_updated":"2024-04-26T02:23:24Z","snapshot_observed_at":"2026-08-16T13:58:02.005422Z","submitted_at":"2024-04-25T03:14:49Z","title":"Semantically consistent Video-to-Audio Generation using Multimodal Language Large Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16305","snapshot_observed_at":"2026-08-11T23:05:27.373999Z","title":"Semantically consistent video-to-audio generation using multimodal language large model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15220","last_updated":"2024-12-03T21:48:08Z","snapshot_observed_at":"2026-08-14T05:21:49.294095Z","submitted_at":"2024-12-03T21:48:08Z","title":"SyncFlow: Toward Temporally Aligned Joint Audio-Video Generation from Text","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-11T23:05:27.373999Z"},"links":{"cited_paper":"/paper/2404.16305","citing_paper":"/paper/2412.15220"},"observation_digest":"sha256:9e98995057841a420f0ceccd75860a34645354a8c4d586c3a4d3a0bce8de106b","observation_id":"faad95cb-ed2f-4b8d-8d8c-e712d49709e3","resolution":{"observed_at":"2026-08-11T23:05:27.373999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03204","last_updated":"2023-05-04T23:27:21Z","snapshot_observed_at":"2026-08-16T15:35:29.721013Z","submitted_at":"2023-05-04T23:27:21Z","title":"VideoOFA: Two-Stage Pre-Training for Video-to-Text Generation","version":1},"cited_work":{"arxiv_id":"2305.03204","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.03204","snapshot_observed_at":"2026-08-11T23:05:27.703270Z","title":"VideoOFA: Two-Stage Pre-Training for Video-to-Text Generation","venue":"cs.CV","work_id":"7c91a56b-404e-4ddb-875f-d88c89203c2a","year":2023},"citing_paper":{"arxiv_id":"2412.15220","last_updated":"2024-12-03T21:48:08Z","snapshot_observed_at":"2026-08-14T05:21:49.294095Z","submitted_at":"2024-12-03T21:48:08Z","title":"SyncFlow: Toward Temporally Aligned Joint Audio-Video Generation from Text","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-11T23:05:27.379194Z"},"links":{"cited_paper":"/paper/2305.03204","citing_paper":"/paper/2412.15220"},"observation_digest":"sha256:8f142dc0afa855eaaae3e022e9244125937085480b2acd684e62f41bd11ad455","observation_id":"0f8d7c8f-0779-4c12-b2e9-e5a4d6623cd4","resolution":{"observed_at":"2026-08-11T23:05:27.710092Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:05:27.751198Z","title":"Synctalkface: Talking face generation with precise lip-syncing via audio-lip memory","venue":null,"work_id":"f0f1da77-64a0-402e-a1a5-d56400f76417","year":null},"citing_paper":{"arxiv_id":"2412.15220","last_updated":"2024-12-03T21:48:08Z","snapshot_observed_at":"2026-08-14T05:21:49.294095Z","submitted_at":"2024-12-03T21:48:08Z","title":"SyncFlow: Toward Temporally Aligned Joint Audio-Video Generation from Text","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-11T23:05:27.417239Z"},"links":{"citing_paper":"/paper/2412.15220"},"observation_digest":"sha256:c375884c80c084b2fce20d4e05399b9975a42754383962a41bfeb0aeab3d71fa","observation_id":"350d20ca-4483-415d-a886-5c9fe983c1ac","resolution":{"observed_at":"2026-08-11T23:05:27.756352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03648","last_updated":"2024-10-16T14:24:53Z","snapshot_observed_at":"2026-08-16T14:15:31.715199Z","submitted_at":"2024-07-04T05:38:49Z","title":"High Fidelity Text-Guided Music Editing via Single-Stage Flow Matching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03648","snapshot_observed_at":"2026-08-11T23:05:27.403462Z","title":"High fidelity text-guided music generation and editing via single-stage flow matching","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15220","last_updated":"2024-12-03T21:48:08Z","snapshot_observed_at":"2026-08-14T05:21:49.294095Z","submitted_at":"2024-12-03T21:48:08Z","title":"SyncFlow: Toward Temporally Aligned Joint Audio-Video Generation from Text","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-11T23:05:27.403462Z"},"links":{"cited_paper":"/paper/2407.03648","citing_paper":"/paper/2412.15220"},"observation_digest":"sha256:f2654ddc242438fb2a0f7e966370ed18c38c27257e35bc4fd4d7b71ed99e6e81","observation_id":"a22d6344-4e16-45de-85ab-90bfdaa21930","resolution":{"observed_at":"2026-08-11T23:05:27.403462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05284","last_updated":"2024-01-30T04:49:16Z","snapshot_observed_at":"2026-08-16T15:25:26.441326Z","submitted_at":"2023-06-08T15:31:05Z","title":"Simple and Controllable Music Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05284","snapshot_observed_at":"2026-08-11T23:05:27.384167Z","title":"Simple and controllable music generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15220","last_updated":"2024-12-03T21:48:08Z","snapshot_observed_at":"2026-08-14T05:21:49.294095Z","submitted_at":"2024-12-03T21:48:08Z","title":"SyncFlow: Toward Temporally Aligned Joint Audio-Video Generation from Text","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T23:05:27.384167Z"},"links":{"cited_paper":"/paper/2306.05284","citing_paper":"/paper/2412.15220"},"observation_digest":"sha256:6eba04d272d4385770d0393da575b10ca875361c10eabf3ca9e579c05a12032b","observation_id":"2defa89d-753a-45e7-a028-b0f7c1ae5177","resolution":{"observed_at":"2026-08-11T23:05:27.384167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17842","last_updated":"2025-02-25T09:34:26Z","snapshot_observed_at":"2026-08-16T13:48:46.813784Z","submitted_at":"2024-05-28T05:43:03Z","title":"MMDisCo: Multi-Modal Discriminator-Guided Cooperative Diffusion for Joint Audio and Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17842","snapshot_observed_at":"2026-08-11T23:05:27.388700Z","title":"Discriminator-guided cooperative diffusion for joint audio and video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15220","last_updated":"2024-12-03T21:48:08Z","snapshot_observed_at":"2026-08-14T05:21:49.294095Z","submitted_at":"2024-12-03T21:48:08Z","title":"SyncFlow: Toward Temporally Aligned Joint Audio-Video Generation from Text","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T23:05:27.388700Z"},"links":{"cited_paper":"/paper/2405.17842","citing_paper":"/paper/2412.15220"},"observation_digest":"sha256:25047f179bfc11d85d3478ead6eb5c35536b0d8735c0b1f2510e61cfb297f72c","observation_id":"6cdbb547-8170-43c3-9e1e-9e21ee381a27","resolution":{"observed_at":"2026-08-11T23:05:27.388700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.15220","last_updated":"2024-12-03T21:48:08Z","latest_version":1,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-14T05:21:49.294095Z","submitted_at":"2024-12-03T21:48:08Z","title":"SyncFlow: Toward Temporally Aligned Joint Audio-Video Generation from Text"},"reference_resolution":{"displayed":19,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":1,"verified_fuzzy":1},"total_outbound_references":19},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 19 of 19 outbound references and 10 inbound Pith citation observations for arXiv:2412.15220."}