{"as_of":"2026-08-13T21:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7bbc89d33bf3da81710eb8de50c1b2eb59939c7307ee5c1ac602953a3c2c30fd","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T03:12:39.760716Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T05:08:20.178883Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.14189","snapshot_observed_at":"2026-07-31T05:08:20.178883Z","title":"MultiRef-Compass: Towards comprehensive evaluation of multi-reference-to-audio-video generation.arXiv preprint arXiv:2607.14189, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28509","last_updated":"2026-07-30T16:48:28Z","snapshot_observed_at":"2026-08-09T21:08:35.257576Z","submitted_at":"2026-07-30T16:48:28Z","title":"RefCaptioner: Multi-Reference Image-Grounded Video Captioning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-31T05:08:20.178883Z"},"links":{"cited_paper":"/paper/2607.14189","citing_paper":"/paper/2607.28509"},"observation_digest":"sha256:622940c3d5023b15740483a655a4709ace456dece9b38e6e576840e5b8570ef0","observation_id":"16ef230b-d319-41b9-8b12-9628295b96e0","resolution":{"observed_at":"2026-07-31T05:08:20.178883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.14189/citation-record","integrity":"/paper/2607.14189/integrity","json":"/paper/2607.14189/citation-record.json","paper":"/paper/2607.14189"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:12:33.281139Z","title":"Videophy:Evaluatingphysicalcommonsense for video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:33.281139Z"},"links":{"citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:123d3dd65e1dc437131393407b4ae8fadb510527b9cdba5fb843394a222fbdb6","observation_id":"8c187932-4dbc-4f84-9cb9-52579695a406","resolution":{"observed_at":"2026-08-02T03:12:33.281139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-13T00:13:12.479004Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-08-02T03:12:33.331799Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:33.331799Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:9c4c440719cc8f4321c9ef6a21fc8ed2383899b7ea44159c9fadeff52607ebcf","observation_id":"f9db2bae-7545-4317-a7c5-37aff2e01a3e","resolution":{"observed_at":"2026-08-02T03:12:33.331799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.21094","last_updated":"2026-06-02T17:15:46Z","snapshot_observed_at":"2026-08-06T21:10:12.336800Z","submitted_at":"2025-12-24T10:30:35Z","title":"T2AV-Compass: Towards Unified Evaluation for Text-to-Audio-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.21094","snapshot_observed_at":"2026-08-02T03:12:33.432210Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:33.432210Z"},"links":{"cited_paper":"/paper/2512.21094","citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:99808cad4686cdee23c83dc0e84e02b1de0acc8ae58e2f412e7587d4b06f060b","observation_id":"ddffdfc7-dd40-4122-816e-2cf859e5e347","resolution":{"observed_at":"2026-08-02T03:12:33.432210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:12:33.566559Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:33.566559Z"},"links":{"citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:7b4969d4f27f42c3d24241f67dde0a1c300fba26c739e268862286869d3e82be","observation_id":"7b9feabd-07c1-474b-9712-e5ae6684e797","resolution":{"observed_at":"2026-08-02T03:12:33.566559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.07143","last_updated":"2020-08-10T13:50:24Z","snapshot_observed_at":"2026-08-13T13:28:56.694752Z","submitted_at":"2020-05-14T17:02:15Z","title":"ECAPA-TDNN: Emphasized Channel Attention, Propagation and Aggregation in TDNN Based Speaker Verification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.07143","snapshot_observed_at":"2026-08-02T03:12:33.672257Z","title":"2020.Ecapa-tdnn:Emphasizedchannelattention,prop- agationandaggregationintdnnbasedspeakerverifica- tion.arXiv preprint arXiv:2005.07143","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:33.672257Z"},"links":{"cited_paper":"/paper/2005.07143","citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:4e0b049915248f92e6b003c718c72b5e3bdfbb2e64d95d404ceb376117d33fdd","observation_id":"c055c4f8-d9a5-40c0-90b8-a0c9d3ae452c","resolution":{"observed_at":"2026-08-02T03:12:33.672257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:12:33.810808Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:33.810808Z"},"links":{"citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:e537f978c3dd23a12256e9c5d7d06d10e0bce3c6338af3981dca0a0415b63fbc","observation_id":"ecb759d4-c880-4045-9e61-f332dbbc49ba","resolution":{"observed_at":"2026-08-02T03:12:33.810808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:12:33.929694Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:33.929694Z"},"links":{"citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:4dd6b17cd8db833017dbc62600f9342966fc707b3eb7ef4dd832647a49a7ea85","observation_id":"f136d5c3-5b8f-4137-916a-b87f039298aa","resolution":{"observed_at":"2026-08-02T03:12:33.929694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:12:34.077827Z","title":"HappyHorse:TheSimple,All-in- OneAIVideoPlatform","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:34.077827Z"},"links":{"citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:b27136f3ed67ca55144f44742f6f1a1dd3ea01fd54b37f6f4cfe29e723bc5ba1","observation_id":"48c9cd46-125d-445a-9c92-4e045e7f8862","resolution":{"observed_at":"2026-08-02T03:12:34.077827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:12:34.244154Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:34.244154Z"},"links":{"citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:14cc236b39964849cbab3fc837ddbc8cb0e8b3c36ced03dd279769b6510c4564","observation_id":"ad5df6c1-b4ab-41c3-a34d-fbdafd39175b","resolution":{"observed_at":"2026-08-02T03:12:34.244154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:12:34.441093Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:34.441093Z"},"links":{"citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:ff676c823350070605fa71d3a8f4a156abb412037295c9eefbd2e7b86a746fe5","observation_id":"7427aa52-fd5f-4e1d-a607-464c5cf9ec63","resolution":{"observed_at":"2026-08-02T03:12:34.441093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:12:34.601765Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:34.601765Z"},"links":{"citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:b3941d2f9788436a5586a3053be419d9dd6104e7a80d66f077ac39a901a54203","observation_id":"6d5f55cc-2326-4074-8b09-e53bb9b7e674","resolution":{"observed_at":"2026-08-02T03:12:34.601765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:12:34.875762Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:34.875762Z"},"links":{"citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:f557ce5c36fe611efd4a653579126f001b3e1ae659fac90fc578b3da1095ddc3","observation_id":"2b43004a-e514-442c-a35c-b576b6d8c749","resolution":{"observed_at":"2026-08-02T03:12:34.875762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:12:34.709589Z","title":"InCVPR, 21807–21818","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:34.709589Z"},"links":{"citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:5bbddb9ab5a215ff979740e2de68f3c614350f0371a90efabba8d7ad33952d18","observation_id":"76f636d3-9020-42ff-bd2c-a59dfa0a1fea","resolution":{"observed_at":"2026-08-02T03:12:34.709589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:12:35.177857Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:35.177857Z"},"links":{"citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:d22388153cec19786d2da36013980de7f3f2fccbe66e632a96c5abc85661a89b","observation_id":"71c70b0a-e9c9-49f0-b383-f317171c18ec","resolution":{"observed_at":"2026-08-02T03:12:35.177857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:12:35.030269Z","title":"C.; and Liu, Z","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:35.030269Z"},"links":{"citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:ebae7508939ac821796e966b11b366e20dc9f67a14e8b7311333012a278ce8e0","observation_id":"15961dec-0d5d-4e33-bb4b-2694c52a7f9b","resolution":{"observed_at":"2026-08-02T03:12:35.030269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:12:35.444566Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:35.444566Z"},"links":{"citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:7e0e7a833a15132edbed8a263c059ed5eef7e63c4d3b8437dd8bff632466f1e7","observation_id":"1f832c5f-cba1-44df-85cf-7d4b89bfec15","resolution":{"observed_at":"2026-08-02T03:12:35.444566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-13T11:49:40.605159Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-08-02T03:12:35.343990Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:35.343990Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:434ee05f01d3e5db252a9e6be11861f0b7aa908327ca9d42e08a4a9b3550840f","observation_id":"1a10faba-ffcd-4946-bc5a-5c7f84600063","resolution":{"observed_at":"2026-08-02T03:12:35.343990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:12:35.764981Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:35.764981Z"},"links":{"citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:0f71fa34f15973188d9986e22cd875f81eff2cb5082156c13748beb79b71531a","observation_id":"d1715281-8a51-4205-b8b2-c5a607f50e13","resolution":{"observed_at":"2026-08-02T03:12:35.764981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.26244","last_updated":"2026-05-25T18:12:09Z","snapshot_observed_at":"2026-08-06T05:46:08.521756Z","submitted_at":"2026-05-25T18:12:09Z","title":"LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.26244","snapshot_observed_at":"2026-08-02T03:12:35.604423Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:35.604423Z"},"links":{"cited_paper":"/paper/2605.26244","citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:79f6a282bd1d1be1d7c32ac4c7cc9327881744730ea4ffc586f4be270411ddd0","observation_id":"c05434a9-8c6c-41ec-8198-29c3db0dd505","resolution":{"observed_at":"2026-08-02T03:12:35.604423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:12:36.096597Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:36.096597Z"},"links":{"citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:a59943109ab0b056e55e01f838685e80b42449ae1381b48914ce1605d76abc37","observation_id":"ccadb6e9-75e5-411a-8a98-d83c75f8c538","resolution":{"observed_at":"2026-08-02T03:12:36.096597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:12:35.930453Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:35.930453Z"},"links":{"citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:773240106f6ac5dc93c714e5a70ca9d936d191ab173d0f4503cedcbe54d6af1f","observation_id":"263e65ba-7f2c-4507-84e9-9c276274c8c5","resolution":{"observed_at":"2026-08-02T03:12:35.930453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:12:36.520016Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:36.520016Z"},"links":{"citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:4ea03d1d20518c6857c97c77068c8016548384cb05a6a06bec7099cfb242092d","observation_id":"e3ce312c-4a32-4289-96c5-60ca5a1c990b","resolution":{"observed_at":"2026-08-02T03:12:36.520016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:12:36.345068Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:36.345068Z"},"links":{"citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:9cebb74d99d77b3e8fe1bffd0ce8dba347bbf45893553c0191b2a260d1718d9a","observation_id":"46ee03b0-7d40-420c-9d36-b188e3e38494","resolution":{"observed_at":"2026-08-02T03:12:36.345068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:12:36.878389Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:36.878389Z"},"links":{"citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:621cd482f37d3b98cd1bc29ca3bf3b0632aa193fc3aedb40a2cd2aff9c304894","observation_id":"fb274c2f-b980-43cb-bf43-6984b4f12bc7","resolution":{"observed_at":"2026-08-02T03:12:36.878389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.14148","last_updated":"2026-04-15T17:59:40Z","snapshot_observed_at":"2026-08-12T10:49:35.463190Z","submitted_at":"2026-04-15T17:59:40Z","title":"Seedance 2.0: Advancing Video Generation for World Complexity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.14148","snapshot_observed_at":"2026-08-02T03:12:36.717811Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:36.717811Z"},"links":{"cited_paper":"/paper/2604.14148","citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:09437defa934a2af07000e6acb0c7d4e9d97d034cc0b9a29fe5eab5fbb09f5d4","observation_id":"06be7cc2-5021-4ff5-aec6-71e20b809b86","resolution":{"observed_at":"2026-08-02T03:12:36.717811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05139","last_updated":"2025-02-07T18:15:57Z","snapshot_observed_at":"2026-07-06T20:33:01.960703Z","submitted_at":"2025-02-07T18:15:57Z","title":"Meta Audiobox Aesthetics: Unified Automatic Quality Assessment for Speech, Music, and Sound","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05139","snapshot_observed_at":"2026-08-02T03:12:37.198508Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:37.198508Z"},"links":{"cited_paper":"/paper/2502.05139","citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:ea90ec819ae21a70bd53e50141679b66be1eed723ef6694a133df4493ee020fb","observation_id":"1d7b737a-868e-4cf5-94c2-103ddb59a5e1","resolution":{"observed_at":"2026-08-02T03:12:37.198508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.16776","last_updated":"2025-12-18T17:08:12Z","snapshot_observed_at":"2026-08-13T09:50:32.293596Z","submitted_at":"2025-12-18T17:08:12Z","title":"Kling-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.16776","snapshot_observed_at":"2026-08-02T03:12:37.050305Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:37.050305Z"},"links":{"cited_paper":"/paper/2512.16776","citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:aacbaab99d7650cf126c27083f630b29e0d40aef964a9764cc12c21f48c80109","observation_id":"d2b08512-9b15-4ed8-adba-db19ddd87e4f","resolution":{"observed_at":"2026-08-02T03:12:37.050305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:12:37.537839Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:37.537839Z"},"links":{"citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:2b89db1dae2b178351710cdeee426cf8720dd7f981c0d40f252788a100f2d9f2","observation_id":"96be57eb-0630-4ee4-b080-5ef1f2458d2b","resolution":{"observed_at":"2026-08-02T03:12:37.537839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-08-12T22:34:51.361078Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-02T03:12:37.369244Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:37.369244Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:49f4e5a840def24ee327859a06c93e6e04547c4f4b023c7959a6f777a62b0932","observation_id":"68442946-db2a-47c0-8ec6-61f35f373972","resolution":{"observed_at":"2026-08-02T03:12:37.369244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:12:37.620092Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:37.620092Z"},"links":{"citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:b0e709101ffb790693b56c1a7bb9da7f549712855cca453429617e7766bc7164","observation_id":"74751092-09d0-4c66-ad2b-d76ce78901d0","resolution":{"observed_at":"2026-08-02T03:12:37.620092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:12:37.548982Z","title":"Univbench:To- wards unified evaluation for video foundation models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:37.548982Z"},"links":{"citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:a49f9690df49d7d656d70202b432748ac355dc0099432d8c798b34eb9bab51b1","observation_id":"c973288d-663e-4621-9c6d-b20cb8a6b8e2","resolution":{"observed_at":"2026-08-02T03:12:37.548982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.24652","last_updated":"2026-05-23T16:42:39Z","snapshot_observed_at":"2026-08-12T16:57:00.313541Z","submitted_at":"2026-05-23T16:42:39Z","title":"AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.24652","snapshot_observed_at":"2026-08-02T03:12:37.865575Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:37.865575Z"},"links":{"cited_paper":"/paper/2605.24652","citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:8c099e1bd3bd2b8220ad040b4e7948ffe8ee153069c6625d17779bd697404e91","observation_id":"cac83026-c1cb-4992-9284-e277ce7c22a2","resolution":{"observed_at":"2026-08-02T03:12:37.865575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:12:37.708506Z","title":"H.; Yan, H.; Liu, J.-W.; Zhang, C.; Feng, J.; and Shou, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:37.708506Z"},"links":{"citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:bc12904b9f7127790daa33019cc534591c06ca5a79a8f15eb25ff4a00254d4df","observation_id":"13d563bf-21b3-4cb6-9872-d3b41e405014","resolution":{"observed_at":"2026-08-02T03:12:37.708506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:12:38.110309Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:38.110309Z"},"links":{"citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:bd42a3df851dedb1887c4acfec3fb72987fb59fc086bebec9500bf72e97e39ee","observation_id":"a4b115aa-7747-488b-8abc-99d7f97e3d0a","resolution":{"observed_at":"2026-08-02T03:12:38.110309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08089","last_updated":"2023-08-16T01:43:41Z","snapshot_observed_at":"2026-07-06T16:06:38.424057Z","submitted_at":"2023-08-16T01:43:41Z","title":"DragNUWA: Fine-grained Control in Video Generation by Integrating Text, Image, and Trajectory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08089","snapshot_observed_at":"2026-08-02T03:12:37.996979Z","title":"Dragnuwa:Fine-grainedcontrolin video generation by integrating text, image, and trajec- tory.arXiv preprint arXiv:2308.08089","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:37.996979Z"},"links":{"cited_paper":"/paper/2308.08089","citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:9df5529c6f7da6161df0f790106e1d4ea457b70aadc4a904ab5e7ac0e5fafe0b","observation_id":"fa506823-c042-4520-a452-8570fe88bca2","resolution":{"observed_at":"2026-08-02T03:12:37.996979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:12:38.374449Z","title":"UI2V- Bench: An Understanding-based Image-to-video Gen- eration Benchmark.arXiv preprint arXiv:2509.24427","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:38.374449Z"},"links":{"citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:fd83e1874cf44cbfc90903ec7386d3dd033f179c90cde9fc621ac10aad8ba9c9","observation_id":"9432f127-9c04-44aa-9cf8-0358a623873d","resolution":{"observed_at":"2026-08-02T03:12:38.374449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:12:38.189755Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:38.189755Z"},"links":{"citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:726bb283119ecb42490ef32a189c902306f9124e9c6c0e77297e3f6cdc48ac97","observation_id":"4605fa29-d917-43e9-b1d1-f4bd20509f86","resolution":{"observed_at":"2026-08-02T03:12:38.189755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08540","last_updated":"2026-04-09T17:59:39Z","snapshot_observed_at":"2026-08-11T13:18:00.738031Z","submitted_at":"2026-04-09T17:59:39Z","title":"AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.08540","snapshot_observed_at":"2026-08-02T03:12:38.636242Z","title":"multi-reference","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:38.636242Z"},"links":{"cited_paper":"/paper/2604.08540","citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:11c67e4c49045958125beecf3ccc760bc0458b2b9eda0d74fa72a243fbb4099e","observation_id":"8644857c-5477-4bd8-acac-4277519854e5","resolution":{"observed_at":"2026-08-02T03:12:38.636242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-13T02:39:29.395389Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20960","snapshot_observed_at":"2026-08-02T03:12:38.454127Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:38.454127Z"},"links":{"cited_paper":"/paper/2506.20960","citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:9648a80325c7b8e19b2eab66d3acf9ea98562b6407c0676bb4786fbb0ad0ae00","observation_id":"cb12b0a5-33cd-4e82-98f0-de806c00ccc2","resolution":{"observed_at":"2026-08-02T03:12:38.454127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:12:38.794517Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:38.794517Z"},"links":{"citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:382fb684d6c652e4c17c6394ebe5b55f5918727525a143de5baf74913b6a5c6d","observation_id":"9d68244c-5717-4f2a-85cc-b7b300e8b934","resolution":{"observed_at":"2026-08-02T03:12:38.794517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:12:38.872448Z","title":"not_applicable","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:38.872448Z"},"links":{"citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:f1c6826df89271f601fa0c1926f99a9961b1161539729e9458de2909fd0d35c8","observation_id":"b4d0249d-807f-4b63-9118-b3980349afb5","resolution":{"observed_at":"2026-08-02T03:12:38.872448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:12:38.994550Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":141,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:38.994550Z"},"links":{"citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:5649f7193f2df90c013e37fb3bedd4b91980e9fc351019f2b463fce4f513954a","observation_id":"90dccc38-7d87-4206-820e-d6fa403af740","resolution":{"observed_at":"2026-08-02T03:12:38.994550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:12:39.422873Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":151,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:39.422873Z"},"links":{"citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:750054b5fa6c2b7dcdd533b13a647e4c81b2808e1626eb42d324c535e07236a0","observation_id":"6dc0bd44-af16-4ead-834a-3fa74bc06fb1","resolution":{"observed_at":"2026-08-02T03:12:39.422873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:12:39.105569Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":152,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:39.105569Z"},"links":{"citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:94f15686a264b5e4a71dce1af48748686737f0c9c1b8a5db0e73157e766601cd","observation_id":"53d10574-0e75-4d30-8e5f-0a260f8cc7eb","resolution":{"observed_at":"2026-08-02T03:12:39.105569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:12:39.537656Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":162,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:39.537656Z"},"links":{"citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:590d7f7486376879e2dda0b280c3df33d01623b0586314f7bb804bca3e48e038","observation_id":"465cb573-9c16-4066-80bd-f593fca2ea33","resolution":{"observed_at":"2026-08-02T03:12:39.537656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:12:39.187895Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":163,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:39.187895Z"},"links":{"citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:a733388bb33eb2635674920d2c33a59685db3a825d67fa8adab0aa0fa9f02a1d","observation_id":"871e36fe-1c9b-4487-acc3-bd3d8f1b77ad","resolution":{"observed_at":"2026-08-02T03:12:39.187895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:12:39.649380Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":173,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:39.649380Z"},"links":{"citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:4461c0393859fbcee59a052c93dfd5a842f2d8da8d2c48da4b49c8e7bff44633","observation_id":"9922de1f-9985-4043-ae48-34e399116b27","resolution":{"observed_at":"2026-08-02T03:12:39.649380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:12:39.304686Z","title":"22- **2 = Weak related evidence **: something relevant visible, but core requirement mostly missing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":174,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:39.304686Z"},"links":{"citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:f431791384601c614b94254c278576443fd0c4224f1ec12fb8da5e104273977d","observation_id":"427c07cf-47e6-4765-bcc5-4e85300499a9","resolution":{"observed_at":"2026-08-02T03:12:39.304686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:12:39.760716Z","title":"19 20## Cross-language Translation Rule 21 22If Chinese speech is required but the generated speech is a semantically correct English translation, assign score **2**","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":184,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:39.760716Z"},"links":{"citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:9e33fbba8625b34f1b3eb40fdb45d47b57f50054dde7945f6720dd0d57254ef3","observation_id":"db40ba94-d80c-40a6-9b90-8dfdbbe4cb67","resolution":{"observed_at":"2026-08-02T03:12:39.760716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:12:38.254299Z","title":"InICCV, 11975–11986","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:38.254299Z"},"links":{"citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:9b08dfcac93a32c03c942f5048a8e05f61b68f3f20412d859105ec1989065621","observation_id":"f1e761ad-31af-4596-9afc-68874b01ab87","resolution":{"observed_at":"2026-08-02T03:12:38.254299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:12:34.348940Z","title":"InEMNLP, 2105–2123","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:34.348940Z"},"links":{"citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:3094da1c425a6e31934144a0a0000edc2b0792623bbd689e5fe8beb443801135","observation_id":"8cfa3c2d-cb07-456f-851b-6e07eb98f08f","resolution":{"observed_at":"2026-08-02T03:12:34.348940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":51,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 1 inbound Pith citation observation for arXiv:2607.14189."}