{"as_of":"2026-08-09T15:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:72af69ecb58fdc1a78edfc0f4c2bb84cc4c2936343468d55e5bc76fba25ac093","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T00:23:08.279261Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T23:16:52.548806Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T05:56:40.900641Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03897","snapshot_observed_at":"2026-08-06T13:07:28.480478Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20987","last_updated":"2025-07-29T04:13:25Z","snapshot_observed_at":"2026-08-08T08:14:38.727576Z","submitted_at":"2025-07-28T16:47:44Z","title":"JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:28.480478Z"},"links":{"cited_paper":"/paper/2502.03897","citing_paper":"/paper/2507.20987"},"observation_digest":"sha256:77ddd2aa5a9a33b5238cbcb0baff82b8611295a4950565ba94da3da1c21ba6b5","observation_id":"a65d3b03-373a-4102-baa0-0f2224156e3b","resolution":{"observed_at":"2026-08-06T13:07:28.480478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03897","snapshot_observed_at":"2026-08-05T00:05:47.719488Z","title":"Uniform: A unified multi-task diffusion transformer for audio-video generation.arXiv preprint arXiv:2502.03897, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06155","last_updated":"2025-09-07T17:55:03Z","snapshot_observed_at":"2026-08-05T00:05:44.790684Z","submitted_at":"2025-09-07T17:55:03Z","title":"UniVerse-1: Unified Audio-Video Generation via Stitching of Experts","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T00:05:47.719488Z"},"links":{"cited_paper":"/paper/2502.03897","citing_paper":"/paper/2509.06155"},"observation_digest":"sha256:27fede61100b7bf401b6fa5bb7a5b1f7aa960add6511669e59c7d3baccedca62","observation_id":"4e3600b3-5b03-43bb-aa81-f95b258b9571","resolution":{"observed_at":"2026-08-05T00:05:47.719488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03897","snapshot_observed_at":"2026-08-04T12:38:59.844041Z","title":"Uniform: A unified multi-task diffusion transformer for audio-video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03117","last_updated":"2026-06-26T03:58:11Z","snapshot_observed_at":"2026-08-07T05:08:17.345661Z","submitted_at":"2025-10-03T15:43:56Z","title":"Taming Text-to-Sounding Video Generation via Advanced Modality Condition and Interaction","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T12:38:59.844041Z"},"links":{"cited_paper":"/paper/2502.03897","citing_paper":"/paper/2510.03117"},"observation_digest":"sha256:1829b9b3e83467825128d953fb5fe27a6d98e8813b3c7ad697831669380efeed","observation_id":"fe916510-e314-4523-bf4a-49e286c8d953","resolution":{"observed_at":"2026-08-04T12:38:59.844041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"cited_work":{"arxiv_id":"2502.03897","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.03897","snapshot_observed_at":"2026-07-02T05:56:40.900641Z","title":"Uniform: A unified multi-task diffusion transformer for audio- video generation","venue":null,"work_id":"9fe4b156-4eef-4382-8e4a-e908385c3f0e","year":2025},"citing_paper":{"arxiv_id":"2512.23994","last_updated":"2026-05-18T09:30:21Z","snapshot_observed_at":"2026-07-06T22:40:23.205898Z","submitted_at":"2025-12-30T05:22:31Z","title":"PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T19:43:37.604351Z"},"links":{"cited_paper":"/paper/2502.03897","citing_paper":"/paper/2512.23994"},"observation_digest":"sha256:6f3c323fc0f882b3d9a50d827077aefa0ac69f4781b48610fd8e288170137aef","observation_id":"86a4669c-fe76-4651-b85e-aec31796905f","resolution":{"observed_at":"2026-05-16T19:48:21.911645Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"cited_work":{"arxiv_id":"2502.03897","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.03897","snapshot_observed_at":"2026-07-02T05:56:40.900641Z","title":"Uniform: A unified multi-task diffusion transformer for audio- video generation","venue":null,"work_id":"9fe4b156-4eef-4382-8e4a-e908385c3f0e","year":2025},"citing_paper":{"arxiv_id":"2512.23994","last_updated":"2026-05-18T09:30:21Z","snapshot_observed_at":"2026-07-06T22:40:23.205898Z","submitted_at":"2025-12-30T05:22:31Z","title":"PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-21T16:10:31.015783Z"},"links":{"cited_paper":"/paper/2502.03897","citing_paper":"/paper/2512.23994"},"observation_digest":"sha256:ef83b031f664522a00942e4c5b8eba2c74b6545745ff34fa3117463e674a9f6d","observation_id":"750fb1d0-85b6-4f75-8733-d431af5e8148","resolution":{"observed_at":"2026-05-21T16:14:15.270070Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"cited_work":{"arxiv_id":"2502.03897","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.03897","snapshot_observed_at":"2026-07-02T05:56:40.900641Z","title":"Uniform: A unified multi-task diffusion transformer for audio- video generation","venue":null,"work_id":"9fe4b156-4eef-4382-8e4a-e908385c3f0e","year":2025},"citing_paper":{"arxiv_id":"2605.08729","last_updated":"2026-06-29T11:45:55Z","snapshot_observed_at":"2026-08-01T08:29:29.120570Z","submitted_at":"2026-05-09T06:32:54Z","title":"Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-12T02:28:14.734682Z"},"links":{"cited_paper":"/paper/2502.03897","citing_paper":"/paper/2605.08729"},"observation_digest":"sha256:e9cf502228fb32b3de1b25ae09e073b11774e8d2cc2a0aaa495855f3c13ad808","observation_id":"195a3271-7eee-405d-a737-f4f90e7b23f6","resolution":{"observed_at":"2026-05-12T07:36:44.178576Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"cited_work":{"arxiv_id":"2502.03897","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.03897","snapshot_observed_at":"2026-07-02T05:56:40.900641Z","title":"Uniform: A unified multi-task diffusion transformer for audio- video generation","venue":null,"work_id":"9fe4b156-4eef-4382-8e4a-e908385c3f0e","year":2025},"citing_paper":{"arxiv_id":"2605.08729","last_updated":"2026-06-29T11:45:55Z","snapshot_observed_at":"2026-08-01T08:29:29.120570Z","submitted_at":"2026-05-09T06:32:54Z","title":"Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-30T23:26:46.077894Z"},"links":{"cited_paper":"/paper/2502.03897","citing_paper":"/paper/2605.08729"},"observation_digest":"sha256:02234d308ae81f5bcb3405fc223d4f17a5eda4c75a00664897068ea752d524b5","observation_id":"36151287-89fb-4b24-b8e5-a1965a16360e","resolution":{"observed_at":"2026-06-30T23:35:07.816253Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"cited_work":{"arxiv_id":"2502.03897","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.03897","snapshot_observed_at":"2026-07-02T05:56:40.900641Z","title":"Uniform: A unified multi-task diffusion transformer for audio- video generation","venue":null,"work_id":"9fe4b156-4eef-4382-8e4a-e908385c3f0e","year":2025},"citing_paper":{"arxiv_id":"2605.12179","last_updated":"2026-05-12T14:22:13Z","snapshot_observed_at":"2026-08-02T10:11:30.309923Z","submitted_at":"2026-05-12T14:22:13Z","title":"SyncDPO: Enhancing Temporal Synchronization in Video-Audio Joint Generation via Preference Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-13T07:01:40.333448Z"},"links":{"cited_paper":"/paper/2502.03897","citing_paper":"/paper/2605.12179"},"observation_digest":"sha256:7f73cdddc6d1de7f88160ea5ad64bcbef54483bef19cdb5b85a11a7d0cbcb6c4","observation_id":"5472edbe-229b-4705-bada-76c3b06531ac","resolution":{"observed_at":"2026-05-13T07:02:27.198346Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"cited_work":{"arxiv_id":"2502.03897","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.03897","snapshot_observed_at":"2026-07-02T05:56:40.900641Z","title":"Uniform: A unified multi-task diffusion transformer for audio- video generation","venue":null,"work_id":"9fe4b156-4eef-4382-8e4a-e908385c3f0e","year":2025},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-20T05:17:11.690484Z"},"links":{"cited_paper":"/paper/2502.03897","citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:e9b1e89121bc6a5b424e9c8f38cbb94e6078866770520f8e630a6a24d9df7b48","observation_id":"432bf714-ac4c-41fc-8b02-6979188d94b2","resolution":{"observed_at":"2026-05-20T05:18:03.069935Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"cited_work":{"arxiv_id":"2502.03897","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.03897","snapshot_observed_at":"2026-07-02T05:56:40.900641Z","title":"Uniform: A unified multi-task diffusion transformer for audio- video generation","venue":null,"work_id":"9fe4b156-4eef-4382-8e4a-e908385c3f0e","year":2025},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"cited_paper":"/paper/2502.03897","citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:19531fbf47e9d2b60e971f92f34df965b11c363751a3b04801412fa392cd88c6","observation_id":"38385add-b7cf-4a4e-ad03-983f4a143131","resolution":{"observed_at":"2026-06-30T18:04:58.099423Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"cited_work":{"arxiv_id":"2502.03897","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.03897","snapshot_observed_at":"2026-07-02T05:56:40.900641Z","title":"Uniform: A unified multi-task diffusion transformer for audio- video generation","venue":null,"work_id":"9fe4b156-4eef-4382-8e4a-e908385c3f0e","year":2025},"citing_paper":{"arxiv_id":"2606.03183","last_updated":"2026-06-02T05:41:41Z","snapshot_observed_at":"2026-07-06T23:43:27.226603Z","submitted_at":"2026-06-02T05:41:41Z","title":"Inference-Time Scaling for Joint Audio-Video Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T07:49:20.194990Z"},"links":{"cited_paper":"/paper/2502.03897","citing_paper":"/paper/2606.03183"},"observation_digest":"sha256:32c6cd226d7c8c27cb4eccf2c3b919a6da44a7d0fceb8c8c92801a658bba2c74","observation_id":"8e276bec-38a2-4b47-87aa-98b4275b5842","resolution":{"observed_at":"2026-07-02T05:56:40.902116Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03897","snapshot_observed_at":"2026-08-07T23:16:52.548806Z","title":"Uniform: A unified multi-task diffusion transformer for audio-video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05803","last_updated":"2026-08-06T09:38:30Z","snapshot_observed_at":"2026-08-09T14:11:01.295832Z","submitted_at":"2026-08-06T09:38:30Z","title":"Vorch-Omni: Multi-Task Orchestration of Sight and Sound","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T23:16:52.548806Z"},"links":{"cited_paper":"/paper/2502.03897","citing_paper":"/paper/2608.05803"},"observation_digest":"sha256:3567855eba2e3295991b99a7fe996b4bfdf3a67ca76d6b68ca44661182bae6ad","observation_id":"dd650d56-eda4-4d06-80ef-7bbfaa557f56","resolution":{"observed_at":"2026-08-07T23:16:52.548806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.03897/citation-record","integrity":"/paper/2502.03897/integrity","json":"/paper/2502.03897/citation-record.json","paper":"/paper/2502.03897"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T00:23:08.934796Z","title":"Scaling instruction-finetuned language models,","venue":null,"work_id":"1329efb4-8b10-40aa-9279-8d8d53af6f5d","year":2024},"citing_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-09T00:23:08.073414Z"},"links":{"citing_paper":"/paper/2502.03897"},"observation_digest":"sha256:eb3ff0207e3c735f53f9da30768e8ebcf866bc4e0936fc9d99250e235cfe7057","observation_id":"eb615f65-4ba6-4ee9-b023-b5e053e3c579","resolution":{"observed_at":"2026-08-09T00:23:08.939481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T00:23:08.919714Z","title":"Enhanced visual instruction tuning with synthesized image-dialogue data,","venue":null,"work_id":"70c9e663-a4a2-4108-a9ed-f23738e7e890","year":2024},"citing_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-09T00:23:08.079309Z"},"links":{"citing_paper":"/paper/2502.03897"},"observation_digest":"sha256:1ac23ee8538f1c8a9731bfa661f837c8bebd0c1e65f6c361a6621a3359812b6d","observation_id":"f0b09ba4-a94f-4ce7-aa0e-878c7af1993b","resolution":{"observed_at":"2026-08-09T00:23:08.924486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T00:23:08.904641Z","title":"High-resolution image synthesis with latent diffusion models,","venue":null,"work_id":"b372f0f4-a9a0-452c-b1a7-6c04f86dd0cf","year":2022},"citing_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-09T00:23:08.084674Z"},"links":{"citing_paper":"/paper/2502.03897"},"observation_digest":"sha256:05cfec1cb4837f71941bc2753fe70287f7892e2c65e4ead682a915d60db8c16d","observation_id":"2ab83cb4-5302-43a1-ba55-d45aaeb2241c","resolution":{"observed_at":"2026-08-09T00:23:08.909334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T00:23:08.889164Z","title":"Label-guided generative adversarial network for realistic image synthesis,","venue":null,"work_id":"18857599-5c0e-462d-88b8-4775b55f5791","year":2023},"citing_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-09T00:23:08.090212Z"},"links":{"citing_paper":"/paper/2502.03897"},"observation_digest":"sha256:5010269cfbf51c3d6cb89eba2f21887d62321ee354465f5d859baac8a1f80242","observation_id":"ebf2eaa4-9386-4918-89b0-5817a85a3a01","resolution":{"observed_at":"2026-08-09T00:23:08.894367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T00:23:08.095460Z","title":"Audioldm 2: Learn- ing holistic audio generation with self-supervised pretraining,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-09T00:23:08.095460Z"},"links":{"citing_paper":"/paper/2502.03897"},"observation_digest":"sha256:807b3ea95e6744a4668dab6a7772f53dfb2e21fd4ee8cbd8564da33ed4b9be02","observation_id":"dbde849d-a369-4623-8afc-e976d57b79a9","resolution":{"observed_at":"2026-08-09T00:23:08.095460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T00:23:08.864631Z","title":"Continuous emotion-based image-to-music generation,","venue":null,"work_id":"8ab99d9c-c493-4ab1-879e-a9bd49e0af5b","year":2024},"citing_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-09T00:23:08.100701Z"},"links":{"citing_paper":"/paper/2502.03897"},"observation_digest":"sha256:67a26a82583abf27c56106a16bf63040244efad23558e68ac1a4799788b094c0","observation_id":"8664b6c0-2d65-4958-a1d7-29f336028c52","resolution":{"observed_at":"2026-08-09T00:23:08.869392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01422","last_updated":"2025-08-11T12:47:49Z","snapshot_observed_at":"2026-07-06T17:38:42.236375Z","submitted_at":"2024-03-03T07:43:39Z","title":"DreamFrame: Enhancing Video Understanding via Automatically Generated QA and Style-Consistent Keyframes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01422","snapshot_observed_at":"2026-08-09T00:23:08.106301Z","title":"Moviellm: Enhancing long video understanding with ai-generated movies,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-09T00:23:08.106301Z"},"links":{"cited_paper":"/paper/2403.01422","citing_paper":"/paper/2502.03897"},"observation_digest":"sha256:9fada8b9d26ea9a848c1fc13aff3a32f320ca0dffd412cfb079c4c617a0d8230","observation_id":"3f50a790-a285-458a-a68b-6cf1940de7c4","resolution":{"observed_at":"2026-08-09T00:23:08.106301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20404","last_updated":"2024-12-29T08:52:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-29T08:52:49Z","title":"Open-Sora: Democratizing Efficient Video Production for All","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20404","snapshot_observed_at":"2026-08-09T00:23:08.111482Z","title":"Open-sora: Democratizing efficient video production for all,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-09T00:23:08.111482Z"},"links":{"cited_paper":"/paper/2412.20404","citing_paper":"/paper/2502.03897"},"observation_digest":"sha256:7dfbc6bf528c723be7ee784bc4a9fc3435380544aad5a6847d29fd84efe45d53","observation_id":"5910f92a-b6dc-46fa-ab13-7ea114396aa7","resolution":{"observed_at":"2026-08-09T00:23:08.111482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T00:23:08.849726Z","title":"Make-a-video: Text-to-video generation without text-video data,","venue":null,"work_id":"4779e16b-d42f-4b3e-9fa9-25071f4fc0db","year":2023},"citing_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-09T00:23:08.116640Z"},"links":{"citing_paper":"/paper/2502.03897"},"observation_digest":"sha256:9d69267f992e80b630d949719e6254d2f816a08354af5f21efd096d58b199212","observation_id":"feaac7ae-57ea-42c7-b5aa-f90d78bff2a2","resolution":{"observed_at":"2026-08-09T00:23:08.854523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T00:23:08.835060Z","title":"Align your latents: High-resolution video synthesis with latent diffusion models,","venue":null,"work_id":"b622af8e-1328-44ba-bec8-bdde4e7989ad","year":2023},"citing_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-09T00:23:08.121660Z"},"links":{"citing_paper":"/paper/2502.03897"},"observation_digest":"sha256:77208428042efccd91da36bb6aa43b61d4b6769f143109146a586aceaa01ad6c","observation_id":"002714fa-c740-45ed-9635-e8fb280aefd2","resolution":{"observed_at":"2026-08-09T00:23:08.839801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T00:23:08.820693Z","title":"Lavie: High-quality video generation with cascaded latent diffusion models,","venue":null,"work_id":"0e1fb491-6038-4d4b-8985-19237f8e598b","year":2024},"citing_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-09T00:23:08.126362Z"},"links":{"citing_paper":"/paper/2502.03897"},"observation_digest":"sha256:5973deab6807df74bd19a6072e7648e37f49a68a571bc49c836583f8cda22f85","observation_id":"ce0abe09-7a46-43f0-b842-5c0468621d8f","resolution":{"observed_at":"2026-08-09T00:23:08.825411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T00:23:08.805760Z","title":"Mm-diffusion: Learning multi-modal diffusion models for joint audio and video generation,","venue":null,"work_id":"251e8322-1e7b-49c8-b973-8b3ae44f6da2","year":2023},"citing_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T00:23:08.131422Z"},"links":{"citing_paper":"/paper/2502.03897"},"observation_digest":"sha256:531573e1f86bd97cc9e74a3d4b810a99445637ce9ca60504411144f813a19a98","observation_id":"07880440-c68c-4ad9-a1d6-90223bad2a21","resolution":{"observed_at":"2026-08-09T00:23:08.810670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T00:23:08.791026Z","title":"Mm-ldm: Multi-modal latent diffusion model for sounding video generation,","venue":null,"work_id":"e927c22c-6cb8-43ed-8a7c-79dc8ca4d165","year":2024},"citing_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-09T00:23:08.136257Z"},"links":{"citing_paper":"/paper/2502.03897"},"observation_digest":"sha256:b0bd4b11adb5e833383fe769face85d6f75b942fc1ba58c7e1d9091287c249a2","observation_id":"bc0aa074-385f-4126-b52c-27a985094677","resolution":{"observed_at":"2026-08-09T00:23:08.796083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T00:23:08.775659Z","title":"Scalable diffusion models with trans- formers,","venue":null,"work_id":"88e5e4ae-73f1-4eae-b492-ea45c1486048","year":2023},"citing_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T00:23:08.140806Z"},"links":{"citing_paper":"/paper/2502.03897"},"observation_digest":"sha256:f7a712aa5df8649acd510cea793f4ef300a00442a8f3ceb1451867fea1de3701","observation_id":"1c12b223-f672-482f-8076-7c5d1280b56b","resolution":{"observed_at":"2026-08-09T00:23:08.780892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T00:23:08.760391Z","title":"Mmdisco: Multi-modal discriminator-guided cooperative diffusion for joint audio and video generation,","venue":null,"work_id":"a7317941-efd6-4b4f-af1a-18a179b044a0","year":2025},"citing_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-09T00:23:08.145376Z"},"links":{"citing_paper":"/paper/2502.03897"},"observation_digest":"sha256:7d51ddfa6a51e4a40d30aa1fb24bfcb4b16992284082d29706950ba5fe842928","observation_id":"7140319c-c2c3-472b-9d74-28f2498a66e8","resolution":{"observed_at":"2026-08-09T00:23:08.765428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07686","last_updated":"2024-06-11T20:05:58Z","snapshot_observed_at":"2026-08-07T10:32:51.835613Z","submitted_at":"2024-06-11T20:05:58Z","title":"AV-DiT: Efficient Audio-Visual Diffusion Transformer for Joint Audio and Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07686","snapshot_observed_at":"2026-08-09T00:23:08.150079Z","title":"Av-dit: Efficient audio-visual diffusion transformer for joint audio and video generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T00:23:08.150079Z"},"links":{"cited_paper":"/paper/2406.07686","citing_paper":"/paper/2502.03897"},"observation_digest":"sha256:4ccab6b1ecaba62a2d9cfb298fbb0e2aacf6f235b9948444994c3a3121949a91","observation_id":"78bd0cc2-3f69-46da-b5b9-4234d5abef5e","resolution":{"observed_at":"2026-08-09T00:23:08.150079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T00:23:08.744792Z","title":"Seeing and hearing: Open-domain visual-audio generation with diffusion latent aligners,","venue":null,"work_id":"a41d36d0-9e45-4069-911b-9aaa232576cf","year":2024},"citing_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-09T00:23:08.154852Z"},"links":{"citing_paper":"/paper/2502.03897"},"observation_digest":"sha256:afeaf2cba5e16cd5bc11238af6ca7ebfc6b0ce37a695fd274872887ddb0c0d52","observation_id":"9eaaf7fb-2fee-45e3-96dd-0f55327083a3","resolution":{"observed_at":"2026-08-09T00:23:08.749722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.12521","last_updated":"2023-09-28T18:38:21Z","snapshot_observed_at":"2026-07-06T15:19:35.578148Z","submitted_at":"2023-04-25T02:28:32Z","title":"Foley Sound Synthesis at the DCASE 2023 Challenge","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.12521","snapshot_observed_at":"2026-08-09T00:23:08.159950Z","title":"Foley sound synthesis at the dcase 2023 challenge,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-09T00:23:08.159950Z"},"links":{"cited_paper":"/paper/2304.12521","citing_paper":"/paper/2502.03897"},"observation_digest":"sha256:8f9d0d449b52b2ee97df35e6e5db35982db293eb3800e31dff65141276a7833c","observation_id":"d9f13782-2114-4f28-9752-f3c33f17ac6d","resolution":{"observed_at":"2026-08-09T00:23:08.159950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T00:23:08.729851Z","title":"Conditional sound generation using neural discrete time-frequency representation learning,","venue":null,"work_id":"d7b45058-efd5-400f-bb38-1235195bf139","year":2021},"citing_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-09T00:23:08.164988Z"},"links":{"citing_paper":"/paper/2502.03897"},"observation_digest":"sha256:e37432347b433fdf0bcf6d10f3e25e0ce533f66011d3b6fb7afee4dcb818cfa3","observation_id":"b07248fb-7b9c-4807-be26-6b34a7feffc8","resolution":{"observed_at":"2026-08-09T00:23:08.734547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T00:23:08.714485Z","title":"Audioldm: Text-to-audio generation with latent diffusion models,","venue":null,"work_id":"071d9b09-5a51-4d5c-ba2a-6cb826cd9e67","year":2023},"citing_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-09T00:23:08.169478Z"},"links":{"citing_paper":"/paper/2502.03897"},"observation_digest":"sha256:edea02fa597fce47abf07c9a5245958d74e65b66f996fee8214b17e5a92495be","observation_id":"c7bdd247-464b-4263-b9e2-d78b0daa5d70","resolution":{"observed_at":"2026-08-09T00:23:08.719456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.08791","last_updated":"2021-10-17T11:14:00Z","snapshot_observed_at":"2026-07-06T11:58:46.444354Z","submitted_at":"2021-10-17T11:14:00Z","title":"Taming Visually Guided Sound Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.08791","snapshot_observed_at":"2026-08-09T00:23:08.173861Z","title":"Taming visually guided sound gener- ation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-09T00:23:08.173861Z"},"links":{"cited_paper":"/paper/2110.08791","citing_paper":"/paper/2502.03897"},"observation_digest":"sha256:d6296d3c51c5f8da6a86d6edccbf014a64f9c201f6c1fd094160e9f80059e238","observation_id":"64883c8d-8162-4ce4-91be-88c0f9a550ec","resolution":{"observed_at":"2026-08-09T00:23:08.173861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T00:23:08.699743Z","title":"Con- ditional generation of audio from video via foley analogies,","venue":null,"work_id":"665d4304-6290-454b-8504-a43d6aa27ef0","year":2023},"citing_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T00:23:08.178960Z"},"links":{"citing_paper":"/paper/2502.03897"},"observation_digest":"sha256:3612531c665dc9c8819f3a0e5e52e32b09d5ac13a230ef1e650333363fd0de91","observation_id":"85bdd7f3-6e09-4ac7-a8aa-0412476b1f80","resolution":{"observed_at":"2026-08-09T00:23:08.704609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T00:23:08.683498Z","title":"Diff-foley: Synchro- nized video-to-audio synthesis with latent diffusion models,","venue":null,"work_id":"965fad64-0513-4b2a-863b-fed090fceee3","year":2024},"citing_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T00:23:08.183545Z"},"links":{"citing_paper":"/paper/2502.03897"},"observation_digest":"sha256:ce504ad317ae0e249debb01a814cbcba4d2dd043d9924d7693d78bed732fef95","observation_id":"f8bc7a9e-a1ad-4621-b474-6e489e3f1578","resolution":{"observed_at":"2026-08-09T00:23:08.688866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01494","last_updated":"2024-07-01T17:35:56Z","snapshot_observed_at":"2026-08-07T10:46:50.742580Z","submitted_at":"2024-07-01T17:35:56Z","title":"FoleyCrafter: Bring Silent Videos to Life with Lifelike and Synchronized Sounds","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01494","snapshot_observed_at":"2026-08-09T00:23:08.188006Z","title":"Foleycrafter: Bring silent videos to life with lifelike and synchronized sounds,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-09T00:23:08.188006Z"},"links":{"cited_paper":"/paper/2407.01494","citing_paper":"/paper/2502.03897"},"observation_digest":"sha256:ba47c23d92781b6f47a01d45500a7d1be67939fffce2ce5dfeb842100ba66038","observation_id":"3650c39e-68d2-4981-9145-f8c25141abf9","resolution":{"observed_at":"2026-08-09T00:23:08.188006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T00:23:08.667551Z","title":"Temporally aligned audio for video with autoregression,","venue":null,"work_id":"db874b48-2bb8-4627-9730-ce0ac1d3b0c9","year":2025},"citing_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-09T00:23:08.193050Z"},"links":{"citing_paper":"/paper/2502.03897"},"observation_digest":"sha256:e2ae678400ccd59de4ef6a98980673953236350bc2865afbac1f3232acf50e39","observation_id":"a7bd70ed-4be5-4cb0-9df4-5bf5ce4cc987","resolution":{"observed_at":"2026-08-09T00:23:08.672241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.05679","last_updated":"2025-04-04T21:50:29Z","snapshot_observed_at":"2026-07-06T19:47:30.083298Z","submitted_at":"2024-11-08T16:29:07Z","title":"Tell What You Hear From What You See -- Video to Audio Generation Through Text","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.05679","snapshot_observed_at":"2026-08-09T00:23:08.197960Z","title":"Tell what you hear from what you see–video to audio generation through text,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T00:23:08.197960Z"},"links":{"cited_paper":"/paper/2411.05679","citing_paper":"/paper/2502.03897"},"observation_digest":"sha256:bfbb74e8a21538018e7f7b3045de6b8486c2d3950c8e372cc201b5f13fa66008","observation_id":"bd44a722-c613-4d0f-a766-13a72221c16e","resolution":{"observed_at":"2026-08-09T00:23:08.197960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T00:23:08.652157Z","title":"Frieren: Efficient video-to-audio generation network with rectified flow matching,","venue":null,"work_id":"03aded4f-a8a6-4ace-a880-8a0cc5c83994","year":2024},"citing_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-09T00:23:08.202869Z"},"links":{"citing_paper":"/paper/2502.03897"},"observation_digest":"sha256:ef80c0406da9808ed693aef7da6d4ea80582468b7d385e116d1ce66f708befe7","observation_id":"50349149-657d-4dfc-b7a3-016504b7f5df","resolution":{"observed_at":"2026-08-09T00:23:08.657337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T00:23:08.636981Z","title":"Sound-guided semantic video generation,","venue":null,"work_id":"b15c2db4-c718-4088-83b1-73d405feb07e","year":2022},"citing_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-09T00:23:08.207696Z"},"links":{"citing_paper":"/paper/2502.03897"},"observation_digest":"sha256:e388150d8dfed4605bf8021f3c85646344cf66b773952d7b252c8bca4259b8fd","observation_id":"923602d6-db73-44ca-9b3f-e184c7770c71","resolution":{"observed_at":"2026-08-09T00:23:08.641726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T00:23:08.621910Z","title":"The power of sound (tpos): Audio reactive video gen- eration with stable diffusion,","venue":null,"work_id":"12011ed9-e596-49b7-a1fa-fad427eac93a","year":2023},"citing_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-09T00:23:08.212365Z"},"links":{"citing_paper":"/paper/2502.03897"},"observation_digest":"sha256:7259fc54c7435024a8fc8ee9ab65e53a168adc16230b04dff118aeaa5987fc01","observation_id":"b4aefb80-8523-4756-b44a-0fd2be59938e","resolution":{"observed_at":"2026-08-09T00:23:08.626702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T00:23:08.606936Z","title":"Diverse and aligned audio-to-video generation via text-to-video model adaptation,","venue":null,"work_id":"61ffc3af-db24-4aae-a16f-474b92416cf5","year":2024},"citing_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-09T00:23:08.217083Z"},"links":{"citing_paper":"/paper/2502.03897"},"observation_digest":"sha256:c7c95795c6ef910867431c7c7927ad1a8bf1cd172f4c57f7b3d9cb5164ad4ddf","observation_id":"9fe97c13-9c88-4e1c-bdbf-17a4e0228cd8","resolution":{"observed_at":"2026-08-09T00:23:08.611766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-09T00:23:08.221778Z","title":"Hi- erarchical text-conditional image generation with clip latents,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-09T00:23:08.221778Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2502.03897"},"observation_digest":"sha256:9e5d59bafae46648c8ed005714cd7c84f8a7463f13c9010ec94e5cd0b9763136","observation_id":"f49398eb-38ea-4e18-b229-589ac817dd69","resolution":{"observed_at":"2026-08-09T00:23:08.221778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T00:23:08.226795Z","title":"Denoising diffusion probabilistic models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-09T00:23:08.226795Z"},"links":{"citing_paper":"/paper/2502.03897"},"observation_digest":"sha256:9eff83f22e6a589f0673fff1f234768618b164110185d570d0c83e9a9c2a5e8a","observation_id":"fe0d57e8-7353-4b1b-84fe-0b7ddc3d78e4","resolution":{"observed_at":"2026-08-09T00:23:08.226795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T00:23:08.582988Z","title":"Classifier-free diffusion guidance,","venue":null,"work_id":"9747de8e-06f6-4436-a116-f3f2833969a4","year":2021},"citing_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-09T00:23:08.231336Z"},"links":{"citing_paper":"/paper/2502.03897"},"observation_digest":"sha256:ce44081bcce75cd9076d4d0605183419e587fe22424be59f42c718dc7ab60d32","observation_id":"80ae537c-c41d-4ad7-a043-f2ce4b6e3f48","resolution":{"observed_at":"2026-08-09T00:23:08.587790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T00:23:08.568142Z","title":"Denoising diffusion implicit models,","venue":null,"work_id":"38de0899-3ca6-49b1-8911-595604a87b87","year":2021},"citing_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-09T00:23:08.236123Z"},"links":{"citing_paper":"/paper/2502.03897"},"observation_digest":"sha256:75e97854d499471a10de7f3fa685d2bf0da4ac2ddfc01ae543e9ab6d6c59251f","observation_id":"d4b9864b-da9b-49de-aaf9-2e154250529f","resolution":{"observed_at":"2026-08-09T00:23:08.572749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T00:23:08.240853Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-09T00:23:08.240853Z"},"links":{"citing_paper":"/paper/2502.03897"},"observation_digest":"sha256:925b92360a561c4692f7dc35cb2c78d721dc69e748c9818a09def8b33bdb2276","observation_id":"d14f49b8-6357-4433-a39b-5cab2d52ce44","resolution":{"observed_at":"2026-08-09T00:23:08.240853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T00:23:08.541815Z","title":"Hifi-gan: Generative adversarial networks for efficient and high fidelity speech synthesis,","venue":null,"work_id":"b73b65f4-e5ef-436a-93e7-a63801e8077c","year":2020},"citing_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-09T00:23:08.245669Z"},"links":{"citing_paper":"/paper/2502.03897"},"observation_digest":"sha256:32ac1510e281a1e94fd85a16adfac41ec244438ec4811a35a4d7518c3df5c6ff","observation_id":"caa2c650-9b39-4202-99b4-4168df74a94b","resolution":{"observed_at":"2026-08-09T00:23:08.546974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T00:23:08.526564Z","title":"Vggsound: A large-scale audio-visual dataset,","venue":null,"work_id":"af0c2834-8e2b-4363-9454-1fb26ac84c03","year":2020},"citing_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-09T00:23:08.250345Z"},"links":{"citing_paper":"/paper/2502.03897"},"observation_digest":"sha256:0506d9beaf1a713a256b3fe8066500c9189896201f15989c809a1cd4b59b1c98","observation_id":"266eeb2a-d640-4b3e-8d00-02744a31c756","resolution":{"observed_at":"2026-08-09T00:23:08.531559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T00:23:08.511471Z","title":"Ai choreog- rapher: Music conditioned 3d dance generation with aist++,","venue":null,"work_id":"ef54f1b4-f1bf-4738-98a1-3a2e651fee1b","year":2021},"citing_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-09T00:23:08.255030Z"},"links":{"citing_paper":"/paper/2502.03897"},"observation_digest":"sha256:ce260b66e7b9e2a64cf51f400265cefd02614f05c9b421f57c3ae693530f2998","observation_id":"2fe81b8f-01fb-4973-bf7d-b1b073a6ae4d","resolution":{"observed_at":"2026-08-09T00:23:08.516275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T00:23:08.495583Z","title":"Audio set: An ontology and human-labeled dataset for audio events,","venue":null,"work_id":"e65cdbb6-9eac-4cb1-83b0-8499c1c08e92","year":2017},"citing_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-09T00:23:08.259716Z"},"links":{"citing_paper":"/paper/2502.03897"},"observation_digest":"sha256:f7632ff500880736209647a174d311254a8807d00a3cfdf81dee8d6a20d125bc","observation_id":"b4451862-8e35-4abb-b5f5-be8b6e6cecb7","resolution":{"observed_at":"2026-08-09T00:23:08.500522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T00:23:08.477484Z","title":"The benefit of temporally-strong labels in audio event classification,","venue":null,"work_id":"24d3ae85-12ce-4dda-9fdc-4b64fc4659cd","year":2021},"citing_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-09T00:23:08.264537Z"},"links":{"citing_paper":"/paper/2502.03897"},"observation_digest":"sha256:7ee8897f8fcf5bc17b6aad887be6850d6ce4a9ce57a12497f44e4ad7bcf988cc","observation_id":"0d4e6590-ae9c-439f-93b0-dd4cd9c76806","resolution":{"observed_at":"2026-08-09T00:23:08.484410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T00:23:08.269384Z","title":"Aist dance video database: Multi-genre, multi-dancer, and multi- camera database for dance information processing","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-09T00:23:08.269384Z"},"links":{"citing_paper":"/paper/2502.03897"},"observation_digest":"sha256:a1945c49ef874918274875e2f7cccc3257ffe5e835fcaff06790dc1669fdbe2a","observation_id":"cf39378f-b5b5-42de-aaf6-65dea21aaef0","resolution":{"observed_at":"2026-08-09T00:23:08.269384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-09T00:23:08.274133Z","title":"Pllava: 10 Parameter-free llava extension from images to videos for video dense captioning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-09T00:23:08.274133Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2502.03897"},"observation_digest":"sha256:54be7d8d3190f3138a2b8567428b3c61a985c651a0743ab12bc696d926f0289f","observation_id":"e5033d48-6d2a-4146-939b-5c3e6f9f99bb","resolution":{"observed_at":"2026-08-09T00:23:08.274133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05252","last_updated":"2024-01-10T16:27:38Z","snapshot_observed_at":"2026-08-07T04:04:46.527670Z","submitted_at":"2024-01-10T16:27:38Z","title":"PIXART-{\\delta}: Fast and Controllable Image Generation with Latent Consistency Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05252","snapshot_observed_at":"2026-08-09T00:23:08.279261Z","title":"Pixart- δ: Fast and controllable image generation with latent consistency models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-09T00:23:08.279261Z"},"links":{"cited_paper":"/paper/2401.05252","citing_paper":"/paper/2502.03897"},"observation_digest":"sha256:3a4232d2f7244425ef2dbe4b6e7c59ef8b814f5243d7aaf2ee8acc5673cd8a2e","observation_id":"e23d8b30-0744-4a48-9ac9-f57a8679632d","resolution":{"observed_at":"2026-08-09T00:23:08.279261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","latest_version":5,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":29},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 12 inbound Pith citation observations for arXiv:2502.03897."}