{"as_of":"2026-08-10T06:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dca88b259f53f7e56b349051f5e89abf7b5faa3ce5dda42b72bba54138011e70","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T23:16:52.552901Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.05803/citation-record","integrity":"/paper/2608.05803/integrity","json":"/paper/2608.05803/citation-record.json","paper":"/paper/2608.05803"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00830","snapshot_observed_at":"2026-08-07T23:16:52.478464Z","title":"Zhengcong Fei, Hao Jiang, Di Qiu, Baoxuan Gu, Youqiang Zhang, Jiahua Wang, Jialin Bai, Debang Li, Mingyuan Fan, Guibin Chen, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05803","last_updated":"2026-08-06T09:38:30Z","snapshot_observed_at":"2026-08-09T23:11:35.448769Z","submitted_at":"2026-08-06T09:38:30Z","title":"Vorch-Omni: Multi-Task Orchestration of Sight and Sound","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T23:16:52.478464Z"},"links":{"cited_paper":"/paper/2506.00830","citing_paper":"/paper/2608.05803"},"observation_digest":"sha256:7d7ec31efd2ceed758d4b746bebc66f0ec9ac6c44029d4c3ac6222b999b1dba2","observation_id":"085f7559-aa81-4101-b8b4-4d893902df8a","resolution":{"observed_at":"2026-08-07T23:16:52.478464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:16:52.482667Z","title":"Dreamid-omni: Unified framework for controllable human-centric audio-video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05803","last_updated":"2026-08-06T09:38:30Z","snapshot_observed_at":"2026-08-09T23:11:35.448769Z","submitted_at":"2026-08-06T09:38:30Z","title":"Vorch-Omni: Multi-Task Orchestration of Sight and Sound","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T23:16:52.482667Z"},"links":{"citing_paper":"/paper/2608.05803"},"observation_digest":"sha256:c05ccf397bd6e0709a038e00045d20aa2b79436b9829084244babc78370469ae","observation_id":"b7705bf0-d6d7-4bb3-a837-1f6f546c3682","resolution":{"observed_at":"2026-08-07T23:16:52.482667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:16:53.580232Z","title":"Mmdisco: Multi-modal discriminator- guided cooperative diffusion for joint audio and video generation","venue":null,"work_id":"300adf10-fd85-4deb-b4a7-bfaa89167346","year":2025},"citing_paper":{"arxiv_id":"2608.05803","last_updated":"2026-08-06T09:38:30Z","snapshot_observed_at":"2026-08-09T23:11:35.448769Z","submitted_at":"2026-08-06T09:38:30Z","title":"Vorch-Omni: Multi-Task Orchestration of Sight and Sound","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T23:16:52.491684Z"},"links":{"citing_paper":"/paper/2608.05803"},"observation_digest":"sha256:9af07869f7eca3f5871edf3477518fecaac05db14175f55954975b2dcf63e573","observation_id":"efce4dc6-b3b2-4491-864c-6a11ebde837e","resolution":{"observed_at":"2026-08-07T23:16:53.584280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-08-07T23:16:52.495601Z","title":"Hunyuanvideo 1.5 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05803","last_updated":"2026-08-06T09:38:30Z","snapshot_observed_at":"2026-08-09T23:11:35.448769Z","submitted_at":"2026-08-06T09:38:30Z","title":"Vorch-Omni: Multi-Task Orchestration of Sight and Sound","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T23:16:52.495601Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2608.05803"},"observation_digest":"sha256:b3e6605c44ab105f030887979a1c9f7f06d08ad4b53b85d382f314642d11575c","observation_id":"c560d014-c578-457c-b133-377d5f55c84e","resolution":{"observed_at":"2026-08-07T23:16:52.495601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.30073","last_updated":"2026-05-28T15:21:45Z","snapshot_observed_at":"2026-07-06T23:39:24.682426Z","submitted_at":"2026-05-28T15:21:45Z","title":"Native Audio-Visual Alignment for Generation","version":1},"cited_work":{"arxiv_id":"2605.30073","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.30073","snapshot_observed_at":"2026-08-07T23:16:52.955762Z","title":"Native Audio-Visual Alignment for Generation","venue":"cs.CV","work_id":"10a77f0e-8244-462c-aa9b-2797e6dda174","year":2026},"citing_paper":{"arxiv_id":"2608.05803","last_updated":"2026-08-06T09:38:30Z","snapshot_observed_at":"2026-08-09T23:11:35.448769Z","submitted_at":"2026-08-06T09:38:30Z","title":"Vorch-Omni: Multi-Task Orchestration of Sight and Sound","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T23:16:52.499515Z"},"links":{"cited_paper":"/paper/2605.30073","citing_paper":"/paper/2608.05803"},"observation_digest":"sha256:aeafa288403126e15db9fb030f5b7aabb6dc2e453da50733bbadbab176b636a8","observation_id":"3da2db8c-0201-4506-a4fd-aed8acb3510d","resolution":{"observed_at":"2026-08-07T23:16:52.959820Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.16776","last_updated":"2025-12-18T17:08:12Z","snapshot_observed_at":"2026-07-06T22:39:28.855621Z","submitted_at":"2025-12-18T17:08:12Z","title":"Kling-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.16776","snapshot_observed_at":"2026-08-07T23:16:52.502930Z","title":"Kling-omni technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05803","last_updated":"2026-08-06T09:38:30Z","snapshot_observed_at":"2026-08-09T23:11:35.448769Z","submitted_at":"2026-08-06T09:38:30Z","title":"Vorch-Omni: Multi-Task Orchestration of Sight and Sound","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T23:16:52.502930Z"},"links":{"cited_paper":"/paper/2512.16776","citing_paper":"/paper/2608.05803"},"observation_digest":"sha256:3b7bfd8bcbde2ffcf8ab74b2ac2399b4158ae109d43876a1ddafac032790605a","observation_id":"5b81f74d-1820-4e9d-8c3f-7ca0ab47edb7","resolution":{"observed_at":"2026-08-07T23:16:52.502930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.19679","last_updated":"2026-06-29T16:38:23Z","snapshot_observed_at":"2026-07-06T23:06:16.972438Z","submitted_at":"2026-04-21T16:57:23Z","title":"MMControl: Unified Multi-Modal Control for Joint Audio-Video Generation","version":3},"cited_work":{"arxiv_id":"2604.19679","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.19679","snapshot_observed_at":"2026-08-07T23:16:52.924147Z","title":"MMControl: Unified Multi-Modal Control for Joint Audio-Video Generation","venue":"cs.CV","work_id":"64a255c0-3084-4561-a9b5-dd83ccea0c8d","year":2026},"citing_paper":{"arxiv_id":"2608.05803","last_updated":"2026-08-06T09:38:30Z","snapshot_observed_at":"2026-08-09T23:11:35.448769Z","submitted_at":"2026-08-06T09:38:30Z","title":"Vorch-Omni: Multi-Task Orchestration of Sight and Sound","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T23:16:52.506326Z"},"links":{"cited_paper":"/paper/2604.19679","citing_paper":"/paper/2608.05803"},"observation_digest":"sha256:47bcf6d1a43395d92fb9e271980a7d34e2fe506e95466bedf20dc1a1ce9e6595","observation_id":"9ccd18d3-a82e-4af8-9f5d-da02fe9e350a","resolution":{"observed_at":"2026-08-07T23:16:52.929357Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-07T23:16:52.509929Z","title":"Flow matching for generative modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05803","last_updated":"2026-08-06T09:38:30Z","snapshot_observed_at":"2026-08-09T23:11:35.448769Z","submitted_at":"2026-08-06T09:38:30Z","title":"Vorch-Omni: Multi-Task Orchestration of Sight and Sound","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T23:16:52.509929Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2608.05803"},"observation_digest":"sha256:585c8511bbbc9f04b26a2db00be90dc350e749196385eec2195cf3622d2bda54","observation_id":"787248e6-93ad-49ca-9c0f-a24ddfdf72b8","resolution":{"observed_at":"2026-08-07T23:16:52.509929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-07T23:16:52.513807Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05803","last_updated":"2026-08-06T09:38:30Z","snapshot_observed_at":"2026-08-09T23:11:35.448769Z","submitted_at":"2026-08-06T09:38:30Z","title":"Vorch-Omni: Multi-Task Orchestration of Sight and Sound","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T23:16:52.513807Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2608.05803"},"observation_digest":"sha256:2c918358e9aea0f038cd7dc2f25a129e348781c14c13889d095b104fd48636e5","observation_id":"9468b1d8-23a1-490a-82c1-a3b1ef9b346b","resolution":{"observed_at":"2026-08-07T23:16:52.513807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:16:52.521689Z","title":"Team OpenMOSS","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05803","last_updated":"2026-08-06T09:38:30Z","snapshot_observed_at":"2026-08-09T23:11:35.448769Z","submitted_at":"2026-08-06T09:38:30Z","title":"Vorch-Omni: Multi-Task Orchestration of Sight and Sound","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T23:16:52.521689Z"},"links":{"citing_paper":"/paper/2608.05803"},"observation_digest":"sha256:d9f0b0555ee6b3ed4b89813f95a77f3df6099f20a5bd8184f616bf690a13c0b5","observation_id":"89ef2161-5831-4a26-a182-418b358c793b","resolution":{"observed_at":"2026-08-07T23:16:52.521689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-08-07T23:16:52.529134Z","title":"Team Seedance","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05803","last_updated":"2026-08-06T09:38:30Z","snapshot_observed_at":"2026-08-09T23:11:35.448769Z","submitted_at":"2026-08-06T09:38:30Z","title":"Vorch-Omni: Multi-Task Orchestration of Sight and Sound","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T23:16:52.529134Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2608.05803"},"observation_digest":"sha256:cb23b21d37bdf066e34c3ff25f6ae4652185317325aead498d963809f1956ab3","observation_id":"ae50f3a9-5f51-43d7-b4ea-c0c1fc095286","resolution":{"observed_at":"2026-08-07T23:16:52.529134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.25195","last_updated":"2026-06-01T01:54:28Z","snapshot_observed_at":"2026-08-02T06:55:53.214062Z","submitted_at":"2026-05-24T17:55:11Z","title":"Baton: Explicit Semantic Blueprints for Joint Video-Audio Generation","version":2},"cited_work":{"arxiv_id":"2605.25195","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.25195","snapshot_observed_at":"2026-08-07T23:16:52.629424Z","title":"Baton: Explicit Semantic Blueprints for Joint Video-Audio Generation","venue":"cs.CV","work_id":"b100cb7f-1ae8-4527-8b95-6f471be49d09","year":2026},"citing_paper":{"arxiv_id":"2608.05803","last_updated":"2026-08-06T09:38:30Z","snapshot_observed_at":"2026-08-09T23:11:35.448769Z","submitted_at":"2026-08-06T09:38:30Z","title":"Vorch-Omni: Multi-Task Orchestration of Sight and Sound","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T23:16:52.532992Z"},"links":{"cited_paper":"/paper/2605.25195","citing_paper":"/paper/2608.05803"},"observation_digest":"sha256:cd22b5259399a37e8ae367613f7523d498e7f36d6d9498eefd7ee8c54b0e6aa3","observation_id":"7d54ed40-72b2-4164-9ea7-829bc0695111","resolution":{"observed_at":"2026-08-07T23:16:52.635253Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06155","last_updated":"2025-09-07T17:55:03Z","snapshot_observed_at":"2026-08-05T00:05:44.790684Z","submitted_at":"2025-09-07T17:55:03Z","title":"UniVerse-1: Unified Audio-Video Generation via Stitching of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.06155","snapshot_observed_at":"2026-08-07T23:16:52.540959Z","title":"Universe-1: Unified audio-video generation via stitching of experts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05803","last_updated":"2026-08-06T09:38:30Z","snapshot_observed_at":"2026-08-09T23:11:35.448769Z","submitted_at":"2026-08-06T09:38:30Z","title":"Vorch-Omni: Multi-Task Orchestration of Sight and Sound","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T23:16:52.540959Z"},"links":{"cited_paper":"/paper/2509.06155","citing_paper":"/paper/2608.05803"},"observation_digest":"sha256:88180a14e617663b0da5170c73372e32601fc2a33def2dcf07d6484b20d915c3","observation_id":"b30009e5-84ca-4f87-a714-af268271ee5b","resolution":{"observed_at":"2026-08-07T23:16:52.540959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:16:53.567986Z","title":"Uniavgen: Unified audio and video generation with asymmetric cross-modal interactions","venue":null,"work_id":"ccc57d5d-76af-4ab6-a071-36f46d67bf0c","year":1950},"citing_paper":{"arxiv_id":"2608.05803","last_updated":"2026-08-06T09:38:30Z","snapshot_observed_at":"2026-08-09T23:11:35.448769Z","submitted_at":"2026-08-06T09:38:30Z","title":"Vorch-Omni: Multi-Task Orchestration of Sight and Sound","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T23:16:52.544882Z"},"links":{"citing_paper":"/paper/2608.05803"},"observation_digest":"sha256:53fe224a39aa191771e8f636873b5267c6539b3f875906875e1a0411e5f3991c","observation_id":"d2b55d41-71fa-4823-8db6-cac76c6ffe71","resolution":{"observed_at":"2026-08-07T23:16:53.571568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03897","last_updated":"2025-07-07T10:40:56Z","snapshot_observed_at":"2026-08-09T00:16:57.664764Z","submitted_at":"2025-02-06T09:18:30Z","title":"UniForm: A Unified Multi-Task Diffusion Transformer for Audio-Video Generation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03897","snapshot_observed_at":"2026-08-07T23:16:52.548806Z","title":"Uniform: A unified multi-task diffusion transformer for audio-video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05803","last_updated":"2026-08-06T09:38:30Z","snapshot_observed_at":"2026-08-09T23:11:35.448769Z","submitted_at":"2026-08-06T09:38:30Z","title":"Vorch-Omni: Multi-Task Orchestration of Sight and Sound","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T23:16:52.548806Z"},"links":{"cited_paper":"/paper/2502.03897","citing_paper":"/paper/2608.05803"},"observation_digest":"sha256:1e6bc6a1f0ea19658e2da804ef281035de172a2ef04d1c200da6c59e862c8c9b","observation_id":"dd650d56-eda4-4d06-80ef-7bbfaa557f56","resolution":{"observed_at":"2026-08-07T23:16:52.548806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.18467","last_updated":"2026-05-18T14:27:05Z","snapshot_observed_at":"2026-07-06T23:29:20.279470Z","submitted_at":"2026-05-18T14:27:05Z","title":"InstructAV2AV: Instruction-Guided Audio-Video Joint Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.18467","snapshot_observed_at":"2026-08-07T23:16:52.552901Z","title":"Instructav2av: Instruction-guided audio-video joint editing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05803","last_updated":"2026-08-06T09:38:30Z","snapshot_observed_at":"2026-08-09T23:11:35.448769Z","submitted_at":"2026-08-06T09:38:30Z","title":"Vorch-Omni: Multi-Task Orchestration of Sight and Sound","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T23:16:52.552901Z"},"links":{"cited_paper":"/paper/2605.18467","citing_paper":"/paper/2608.05803"},"observation_digest":"sha256:00165e11cd055bc86c25de8c926a6b2400a4552f084ecf947ef93eae2b52e8a2","observation_id":"d846b8d5-983e-4fe4-b01d-7996cf6fe358","resolution":{"observed_at":"2026-08-07T23:16:52.552901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:16:52.464969Z","title":"Guibin Chen, Dixuan Lin, Jiangping Yang, Youqiang Zhang, Zhengcong Fei, Debang Li, Sheng Chen, Chaofeng Ao, Nuo Pang, Yiming Wang, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05803","last_updated":"2026-08-06T09:38:30Z","snapshot_observed_at":"2026-08-09T23:11:35.448769Z","submitted_at":"2026-08-06T09:38:30Z","title":"Vorch-Omni: Multi-Task Orchestration of Sight and Sound","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-07T23:16:52.464969Z"},"links":{"citing_paper":"/paper/2608.05803"},"observation_digest":"sha256:bbb95d5aa1b120c437a00b152f151356a212daeddde958e1ca1a69bfc522eb0e","observation_id":"088567b2-ec9d-4d18-bd2c-453312f10e2e","resolution":{"observed_at":"2026-08-07T23:16:52.464969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-07T23:16:52.536889Z","title":"Wan: Open and advanced large-scale video generative models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05803","last_updated":"2026-08-06T09:38:30Z","snapshot_observed_at":"2026-08-09T23:11:35.448769Z","submitted_at":"2026-08-06T09:38:30Z","title":"Vorch-Omni: Multi-Task Orchestration of Sight and Sound","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T23:16:52.536889Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2608.05803"},"observation_digest":"sha256:6c9910f4085205d2e5165777397870fac0aeb0fc91605dfb83298b1ffb606d29","observation_id":"87f681e6-8702-48ec-9471-5b10076424dd","resolution":{"observed_at":"2026-08-07T23:16:52.536889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.01284","last_updated":"2025-09-30T21:03:50Z","snapshot_observed_at":"2026-08-06T11:49:53.749464Z","submitted_at":"2025-09-30T21:03:50Z","title":"Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.01284","snapshot_observed_at":"2026-08-07T23:16:52.517841Z","title":"Ovi: Twin backbone cross-modal fusion for audio-video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05803","last_updated":"2026-08-06T09:38:30Z","snapshot_observed_at":"2026-08-09T23:11:35.448769Z","submitted_at":"2026-08-06T09:38:30Z","title":"Vorch-Omni: Multi-Task Orchestration of Sight and Sound","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T23:16:52.517841Z"},"links":{"cited_paper":"/paper/2510.01284","citing_paper":"/paper/2608.05803"},"observation_digest":"sha256:70688ca5189ad9de05911da910404721522408ae6e1930e9db3f363afef2237b","observation_id":"8454eb56-0efb-475a-93c2-af9c3b5f0718","resolution":{"observed_at":"2026-08-07T23:16:52.517841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.30811","last_updated":"2026-06-29T18:35:17Z","snapshot_observed_at":"2026-08-04T07:33:33.279896Z","submitted_at":"2026-06-29T18:35:17Z","title":"AVTok: 1D Unified Tokenization for Holistic Audio-Video Generation","version":1},"cited_work":{"arxiv_id":"2606.30811","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.30811","snapshot_observed_at":"2026-08-07T23:16:52.660947Z","title":"AVTok: 1D Unified Tokenization for Holistic Audio-Video Generation","venue":"cs.CV","work_id":"ca5d43d6-01cf-4d2a-9080-2c570f2a37dd","year":2026},"citing_paper":{"arxiv_id":"2608.05803","last_updated":"2026-08-06T09:38:30Z","snapshot_observed_at":"2026-08-09T23:11:35.448769Z","submitted_at":"2026-08-06T09:38:30Z","title":"Vorch-Omni: Multi-Task Orchestration of Sight and Sound","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T23:16:52.525251Z"},"links":{"cited_paper":"/paper/2606.30811","citing_paper":"/paper/2608.05803"},"observation_digest":"sha256:0bee7bfe6e921ecd3046df87290984a78577a45ac967bab4e058e825ab2a0e6e","observation_id":"d3063727-59cd-4966-925a-49b47f222a7c","resolution":{"observed_at":"2026-08-07T23:16:52.664679Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.09639","last_updated":"2026-06-11T05:58:22Z","snapshot_observed_at":"2026-08-02T02:07:05.154330Z","submitted_at":"2026-06-08T15:35:51Z","title":"CineDance: Towards Next-Generation Multi-Shot Long-Form Cinematic Audio-Video Generation","version":2},"cited_work":{"arxiv_id":"2606.09639","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.09639","snapshot_observed_at":"2026-08-07T23:16:53.342690Z","title":"CineDance: Towards Next-Generation Multi-Shot Long-Form Cinematic Audio-Video Generation","venue":"cs.CV","work_id":"8db551f4-b935-4639-8c5a-e10ebf06546a","year":2026},"citing_paper":{"arxiv_id":"2608.05803","last_updated":"2026-08-06T09:38:30Z","snapshot_observed_at":"2026-08-09T23:11:35.448769Z","submitted_at":"2026-08-06T09:38:30Z","title":"Vorch-Omni: Multi-Task Orchestration of Sight and Sound","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T23:16:52.469576Z"},"links":{"cited_paper":"/paper/2606.09639","citing_paper":"/paper/2608.05803"},"observation_digest":"sha256:69898f8817a993fcc2c9ed83466afc6cae9b1389e30229ffbf23197e658250db","observation_id":"47bbb723-024c-4a6a-8dc9-451b43a86f7e","resolution":{"observed_at":"2026-08-07T23:16:53.347134Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:16:52.474289Z","title":"Speed by simplicity: A single-stream architecture for fast audio-video generative foundation model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05803","last_updated":"2026-08-06T09:38:30Z","snapshot_observed_at":"2026-08-09T23:11:35.448769Z","submitted_at":"2026-08-06T09:38:30Z","title":"Vorch-Omni: Multi-Task Orchestration of Sight and Sound","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T23:16:52.474289Z"},"links":{"citing_paper":"/paper/2608.05803"},"observation_digest":"sha256:7be71d4c7e67d4118c5a001b357141946d02720d607fd1c416949b64417126ac","observation_id":"0fadbedf-3701-49b7-866b-674715952e60","resolution":{"observed_at":"2026-08-07T23:16:52.474289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03233","last_updated":"2026-01-06T18:24:41Z","snapshot_observed_at":"2026-07-06T22:40:51.136169Z","submitted_at":"2026-01-06T18:24:41Z","title":"LTX-2: Efficient Joint Audio-Visual Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.03233","snapshot_observed_at":"2026-08-07T23:16:52.486493Z","title":"Ltx-2: Eﬀicient joint audio-visual foundation model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05803","last_updated":"2026-08-06T09:38:30Z","snapshot_observed_at":"2026-08-09T23:11:35.448769Z","submitted_at":"2026-08-06T09:38:30Z","title":"Vorch-Omni: Multi-Task Orchestration of Sight and Sound","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-07T23:16:52.486493Z"},"links":{"cited_paper":"/paper/2601.03233","citing_paper":"/paper/2608.05803"},"observation_digest":"sha256:e78971ccfa1d0954e0efe81e278a47dc738bf57832e881e2453987b97e326e79","observation_id":"ec011e65-83f0-4560-aa54-334be2c026ab","resolution":{"observed_at":"2026-08-07T23:16:52.486493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.05803","last_updated":"2026-08-06T09:38:30Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T23:11:35.448769Z","submitted_at":"2026-08-06T09:38:30Z","title":"Vorch-Omni: Multi-Task Orchestration of Sight and Sound"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":5,"verified_fuzzy":2},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 0 inbound Pith citation observations for arXiv:2608.05803."}