{"as_of":"2026-08-16T09:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:15ea4ff727d65d6f029c5db799e7f4859a6feeb03e1579fbfa3d8123e7aa228d","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:37:19.640172Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.02271/citation-record","integrity":"/paper/2507.02271/integrity","json":"/paper/2507.02271/citation-record.json","paper":"/paper/2507.02271"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:37:24.409594Z","title":"The Foley grail: The art of performing sound for film, games, and animation","venue":null,"work_id":"f3b88392-3291-43d9-90b9-552d85abb789","year":2014},"citing_paper":{"arxiv_id":"2507.02271","last_updated":"2025-07-03T03:23:11Z","snapshot_observed_at":"2026-08-15T02:31:19.643299Z","submitted_at":"2025-07-03T03:23:11Z","title":"Spotlighting Partially Visible Cinematic Language for Video-to-Audio Generation via Self-distillation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:37:16.105516Z"},"links":{"citing_paper":"/paper/2507.02271"},"observation_digest":"sha256:41695c85e6390a40614365e6eddb5bb2cbfc4c8bf7a6100803f93b0e73acc3b3","observation_id":"69a048b8-bf54-4b91-a693-0876059b899b","resolution":{"observed_at":"2026-08-06T20:37:24.534991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:37:23.357681Z","title":"Deep residual learning for image recog- nition","venue":null,"work_id":"abc902b8-45a5-4211-b9b5-525cacf7da94","year":2016},"citing_paper":{"arxiv_id":"2507.02271","last_updated":"2025-07-03T03:23:11Z","snapshot_observed_at":"2026-08-15T02:31:19.643299Z","submitted_at":"2025-07-03T03:23:11Z","title":"Spotlighting Partially Visible Cinematic Language for Video-to-Audio Generation via Self-distillation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:37:16.695834Z"},"links":{"citing_paper":"/paper/2507.02271"},"observation_digest":"sha256:7946e0b0bb7a0b71109f6a54c0a2aba0e6d785cb73c5449104c7cc453c5ddc5d","observation_id":"1b4e5e8d-32a5-4203-9e59-b2e0858f143d","resolution":{"observed_at":"2026-08-06T20:37:23.444828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:37:17.017938Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.02271","last_updated":"2025-07-03T03:23:11Z","snapshot_observed_at":"2026-08-15T02:31:19.643299Z","submitted_at":"2025-07-03T03:23:11Z","title":"Spotlighting Partially Visible Cinematic Language for Video-to-Audio Generation via Self-distillation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:37:17.017938Z"},"links":{"citing_paper":"/paper/2507.02271"},"observation_digest":"sha256:554a9eba4406af7d0a18690a570dafb747898b472049624fec168b2bd0cb726f","observation_id":"b0c46848-49bc-4f87-9f79-5d9cb000a8a2","resolution":{"observed_at":"2026-08-06T20:37:17.017938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:37:23.199860Z","title":"Densely connected convolutional networks","venue":null,"work_id":"0699c5a6-47e6-4ae6-9cdf-b8c453b5d1a0","year":2017},"citing_paper":{"arxiv_id":"2507.02271","last_updated":"2025-07-03T03:23:11Z","snapshot_observed_at":"2026-08-15T02:31:19.643299Z","submitted_at":"2025-07-03T03:23:11Z","title":"Spotlighting Partially Visible Cinematic Language for Video-to-Audio Generation via Self-distillation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:37:17.087475Z"},"links":{"citing_paper":"/paper/2507.02271"},"observation_digest":"sha256:8c56038d50c139aa0c7aada2042d86e7b3ca554530e588b8fad23ca32a425dc8","observation_id":"ace39fec-2829-4717-88cf-34db85b6c68e","resolution":{"observed_at":"2026-08-06T20:37:23.266003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05551","last_updated":"2024-12-26T15:23:36Z","snapshot_observed_at":"2026-08-12T23:27:09.723258Z","submitted_at":"2024-07-08T01:59:17Z","title":"Read, Watch and Scream! Sound Generation from Text and Video","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05551","snapshot_observed_at":"2026-08-06T20:37:17.308243Z","title":"Read, watch and scream! sound generation from text and video","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02271","last_updated":"2025-07-03T03:23:11Z","snapshot_observed_at":"2026-08-15T02:31:19.643299Z","submitted_at":"2025-07-03T03:23:11Z","title":"Spotlighting Partially Visible Cinematic Language for Video-to-Audio Generation via Self-distillation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:37:17.308243Z"},"links":{"cited_paper":"/paper/2407.05551","citing_paper":"/paper/2507.02271"},"observation_digest":"sha256:50e591181f95676b4076ef7a63e95bd3526a0009be33a26570b6ff3b5a746d00","observation_id":"4f00a0c2-f96d-4e06-944f-345201604a8e","resolution":{"observed_at":"2026-08-06T20:37:17.308243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:37:22.753127Z","title":"Diverse part dis- covery: Occluded person re-identification with part-aware transformer","venue":null,"work_id":"5c967d2b-b8af-4af1-bf11-487608111d8a","year":2021},"citing_paper":{"arxiv_id":"2507.02271","last_updated":"2025-07-03T03:23:11Z","snapshot_observed_at":"2026-08-15T02:31:19.643299Z","submitted_at":"2025-07-03T03:23:11Z","title":"Spotlighting Partially Visible Cinematic Language for Video-to-Audio Generation via Self-distillation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:37:17.481818Z"},"links":{"citing_paper":"/paper/2507.02271"},"observation_digest":"sha256:ffd624e098fb8ce23f7d277c23541c3488e83ffc552098509fdfa7142e41e370","observation_id":"db35df16-0f1b-47b4-8715-a7105ef1ecd5","resolution":{"observed_at":"2026-08-06T20:37:22.814494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:37:22.619245Z","title":"Mitigating and evaluating static bias of ac- tion representations in the background and the foreground","venue":null,"work_id":"9ee1bdba-3cc8-4da3-b728-9a5015c4378e","year":2023},"citing_paper":{"arxiv_id":"2507.02271","last_updated":"2025-07-03T03:23:11Z","snapshot_observed_at":"2026-08-15T02:31:19.643299Z","submitted_at":"2025-07-03T03:23:11Z","title":"Spotlighting Partially Visible Cinematic Language for Video-to-Audio Generation via Self-distillation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:37:17.568223Z"},"links":{"citing_paper":"/paper/2507.02271"},"observation_digest":"sha256:44ab9136ddff3776bd169b334a251cfa8f7c76422f7935d3f505af1a5f23236c","observation_id":"ea159ff9-6ce8-4424-849c-83af5bdab436","resolution":{"observed_at":"2026-08-06T20:37:22.678563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:37:22.441991Z","title":"AudioLDM: Text-to-audio generation with latent diffusion models","venue":null,"work_id":"5c375124-5f2f-40c3-a0cc-2270805e3d6b","year":2023},"citing_paper":{"arxiv_id":"2507.02271","last_updated":"2025-07-03T03:23:11Z","snapshot_observed_at":"2026-08-15T02:31:19.643299Z","submitted_at":"2025-07-03T03:23:11Z","title":"Spotlighting Partially Visible Cinematic Language for Video-to-Audio Generation via Self-distillation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:37:17.636200Z"},"links":{"citing_paper":"/paper/2507.02271"},"observation_digest":"sha256:bb16095563e44b857f88981e294ff567f005be45a0875dc8af008c4ff465726a","observation_id":"6dce6e9e-f5dc-432a-b213-05cb950ed00d","resolution":{"observed_at":"2026-08-06T20:37:22.538386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01095","last_updated":"2025-05-19T07:56:56Z","snapshot_observed_at":"2026-08-15T03:10:54.042099Z","submitted_at":"2022-11-02T13:14:30Z","title":"DPM-Solver++: Fast Solver for Guided Sampling of Diffusion Probabilistic Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01095","snapshot_observed_at":"2026-08-06T20:37:17.798903Z","title":"Dpm-solver++: Fast solver for guided sampling of diffusion probabilistic mod- els","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02271","last_updated":"2025-07-03T03:23:11Z","snapshot_observed_at":"2026-08-15T02:31:19.643299Z","submitted_at":"2025-07-03T03:23:11Z","title":"Spotlighting Partially Visible Cinematic Language for Video-to-Audio Generation via Self-distillation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:37:17.798903Z"},"links":{"cited_paper":"/paper/2211.01095","citing_paper":"/paper/2507.02271"},"observation_digest":"sha256:c92038875bb809fe865a5f5f6f042ccab21ebd586753ff23d752c405fac16298","observation_id":"d62a57df-c626-45fd-b39a-a55d007b256a","resolution":{"observed_at":"2026-08-06T20:37:17.798903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:37:22.234391Z","title":"Diff-foley: Synchronized video-to-audio synthesis with latent diffusion models.Advances in Neural Information Processing Systems, 36,","venue":null,"work_id":"b442ef49-3327-4178-b748-6bdc82c4954a","year":2024},"citing_paper":{"arxiv_id":"2507.02271","last_updated":"2025-07-03T03:23:11Z","snapshot_observed_at":"2026-08-15T02:31:19.643299Z","submitted_at":"2025-07-03T03:23:11Z","title":"Spotlighting Partially Visible Cinematic Language for Video-to-Audio Generation via Self-distillation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:37:17.879008Z"},"links":{"citing_paper":"/paper/2507.02271"},"observation_digest":"sha256:3f752452f42271e78398913d132a3786b5b0fa7b89e520c7b827621a48b4f4da","observation_id":"8f82e688-1ece-4d83-a2b4-dab92dded7ad","resolution":{"observed_at":"2026-08-06T20:37:22.339611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:37:22.044394Z","title":"The filmmaker’s eye: The language of the lens: The power of lenses and the expressive cinematic image","venue":null,"work_id":"8246c163-9af2-42fb-b1ba-d8528263d2c5","year":2019},"citing_paper":{"arxiv_id":"2507.02271","last_updated":"2025-07-03T03:23:11Z","snapshot_observed_at":"2026-08-15T02:31:19.643299Z","submitted_at":"2025-07-03T03:23:11Z","title":"Spotlighting Partially Visible Cinematic Language for Video-to-Audio Generation via Self-distillation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:37:17.958654Z"},"links":{"citing_paper":"/paper/2507.02271"},"observation_digest":"sha256:a94909e6ad8c3d68dfad0a23e18c6bf718492777b4b7330b37fc1ce3431037aa","observation_id":"5212535c-5019-435a-9b49-e5dc42b12f9c","resolution":{"observed_at":"2026-08-06T20:37:22.132569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:37:21.704425Z","title":"Masked generative video-to-audio transformers with enhanced synchronicity","venue":null,"work_id":"99528895-293d-42a3-a904-c09f3e231523","year":2025},"citing_paper":{"arxiv_id":"2507.02271","last_updated":"2025-07-03T03:23:11Z","snapshot_observed_at":"2026-08-15T02:31:19.643299Z","submitted_at":"2025-07-03T03:23:11Z","title":"Spotlighting Partially Visible Cinematic Language for Video-to-Audio Generation via Self-distillation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:37:18.184538Z"},"links":{"citing_paper":"/paper/2507.02271"},"observation_digest":"sha256:1023f0d39acd9f63339a0221f74c1eb540150106734fb367e1e2490b5a5abf34","observation_id":"25fe33b3-7429-46af-b274-99c798f89081","resolution":{"observed_at":"2026-08-06T20:37:21.828307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:37:21.534419Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"e80cc708-e454-44f0-8f58-74a0e82d5618","year":2022},"citing_paper":{"arxiv_id":"2507.02271","last_updated":"2025-07-03T03:23:11Z","snapshot_observed_at":"2026-08-15T02:31:19.643299Z","submitted_at":"2025-07-03T03:23:11Z","title":"Spotlighting Partially Visible Cinematic Language for Video-to-Audio Generation via Self-distillation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:37:18.403758Z"},"links":{"citing_paper":"/paper/2507.02271"},"observation_digest":"sha256:6e3c2fe5e8d13f59beb7b24d1c0966fba3821511f25dbb20124733310346769a","observation_id":"e12fde5f-5029-4e60-9cde-02ca65adfc27","resolution":{"observed_at":"2026-08-06T20:37:21.590179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:37:18.510802Z","title":"Grad-cam: Visual explanations from deep networks via gradient-based localization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.02271","last_updated":"2025-07-03T03:23:11Z","snapshot_observed_at":"2026-08-15T02:31:19.643299Z","submitted_at":"2025-07-03T03:23:11Z","title":"Spotlighting Partially Visible Cinematic Language for Video-to-Audio Generation via Self-distillation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:37:18.510802Z"},"links":{"citing_paper":"/paper/2507.02271"},"observation_digest":"sha256:5b7d399d5c8f03cf93c6fcba8b54aee3d1ec76dbfe5a78487097959534ca5654","observation_id":"e6ed0c00-47cb-4112-a669-9ad94db08c51","resolution":{"observed_at":"2026-08-06T20:37:18.510802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:37:21.289261Z","title":"Denoising diffusion implicit models","venue":null,"work_id":"4a283de7-9895-4b4e-ada8-5a4d9d26d4b6","year":2021},"citing_paper":{"arxiv_id":"2507.02271","last_updated":"2025-07-03T03:23:11Z","snapshot_observed_at":"2026-08-15T02:31:19.643299Z","submitted_at":"2025-07-03T03:23:11Z","title":"Spotlighting Partially Visible Cinematic Language for Video-to-Audio Generation via Self-distillation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:37:18.589032Z"},"links":{"citing_paper":"/paper/2507.02271"},"observation_digest":"sha256:4a16d1e90b7a7c143d672da3ed1d052c5a2bba666adeb2efbb976056771c813e","observation_id":"dbcb4214-e9cb-4123-a6c0-3656e012e064","resolution":{"observed_at":"2026-08-06T20:37:21.420248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13689","last_updated":"2024-09-20T17:59:01Z","snapshot_observed_at":"2026-08-15T15:01:25.119103Z","submitted_at":"2024-09-20T17:59:01Z","title":"Temporally Aligned Audio for Video with Autoregression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.13689","snapshot_observed_at":"2026-08-06T20:37:18.705798Z","title":"Temporally aligned audio for video with autore- gression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02271","last_updated":"2025-07-03T03:23:11Z","snapshot_observed_at":"2026-08-15T02:31:19.643299Z","submitted_at":"2025-07-03T03:23:11Z","title":"Spotlighting Partially Visible Cinematic Language for Video-to-Audio Generation via Self-distillation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:37:18.705798Z"},"links":{"cited_paper":"/paper/2409.13689","citing_paper":"/paper/2507.02271"},"observation_digest":"sha256:86a24b2648cff8a50b2720f1cd74308ccab81ed66d363a6089a9e44bec3600ca","observation_id":"a879510a-756e-404b-aee7-f14b9d686219","resolution":{"observed_at":"2026-08-06T20:37:18.705798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:37:21.122608Z","title":"Removing the background by adding the background: Towards background robust self- supervised video representation learning","venue":null,"work_id":"f433f375-208c-4edb-9842-a66b481dd34d","year":2021},"citing_paper":{"arxiv_id":"2507.02271","last_updated":"2025-07-03T03:23:11Z","snapshot_observed_at":"2026-08-15T02:31:19.643299Z","submitted_at":"2025-07-03T03:23:11Z","title":"Spotlighting Partially Visible Cinematic Language for Video-to-Audio Generation via Self-distillation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:37:18.804143Z"},"links":{"citing_paper":"/paper/2507.02271"},"observation_digest":"sha256:277d2e2c6a447bd9c3616ec3819cb07353454e3d462722b0546c008ed9b35ad5","observation_id":"5364271f-4cb6-4cee-88c7-b28e96dcf8dd","resolution":{"observed_at":"2026-08-06T20:37:21.190004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00320","last_updated":"2025-01-04T18:12:07Z","snapshot_observed_at":"2026-08-12T23:52:40.690851Z","submitted_at":"2024-06-01T06:40:22Z","title":"Frieren: Efficient Video-to-Audio Generation Network with Rectified Flow Matching","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00320","snapshot_observed_at":"2026-08-06T20:37:18.886087Z","title":"Frieren: Efficient video-to-audio generation with rectified flow matching","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02271","last_updated":"2025-07-03T03:23:11Z","snapshot_observed_at":"2026-08-15T02:31:19.643299Z","submitted_at":"2025-07-03T03:23:11Z","title":"Spotlighting Partially Visible Cinematic Language for Video-to-Audio Generation via Self-distillation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:37:18.886087Z"},"links":{"cited_paper":"/paper/2406.00320","citing_paper":"/paper/2507.02271"},"observation_digest":"sha256:362067e9c3735d5321c24c54b8fa137b2eb121a74f149fe9ae2d806e7a375099","observation_id":"61ca4cac-0cdc-4c81-b490-83829effb8c5","resolution":{"observed_at":"2026-08-06T20:37:18.886087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:37:20.963092Z","title":"Sonicvisionlm: Playing sound with vi- sion language models","venue":null,"work_id":"cc5bf4b2-8a28-4f95-bbf0-19053976031b","year":2024},"citing_paper":{"arxiv_id":"2507.02271","last_updated":"2025-07-03T03:23:11Z","snapshot_observed_at":"2026-08-15T02:31:19.643299Z","submitted_at":"2025-07-03T03:23:11Z","title":"Spotlighting Partially Visible Cinematic Language for Video-to-Audio Generation via Self-distillation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:37:18.967426Z"},"links":{"citing_paper":"/paper/2507.02271"},"observation_digest":"sha256:7f234ffb1b983a23af4c3046c85ad6328a2d49b2095b7ff34c79800b7b9f5d5f","observation_id":"dcf0d7b2-3fe4-4f7c-8ca5-6778b45c9083","resolution":{"observed_at":"2026-08-06T20:37:21.041126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:37:20.764161Z","title":"Data- distortion guided self-distillation for deep neural networks","venue":null,"work_id":"7415da10-1591-4156-acf7-bc427b721fc5","year":2019},"citing_paper":{"arxiv_id":"2507.02271","last_updated":"2025-07-03T03:23:11Z","snapshot_observed_at":"2026-08-15T02:31:19.643299Z","submitted_at":"2025-07-03T03:23:11Z","title":"Spotlighting Partially Visible Cinematic Language for Video-to-Audio Generation via Self-distillation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:37:19.069164Z"},"links":{"citing_paper":"/paper/2507.02271"},"observation_digest":"sha256:f933836e63646b86709eb9667ab26bf8a5cdb3da1482a89c13ab237eb074eb75","observation_id":"c58c3f2a-5a27-4d6e-a756-6457b59f5e04","resolution":{"observed_at":"2026-08-06T20:37:20.889079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:37:20.551100Z","title":"Cutmix: Regularization strategy to train strong classifiers with localizable features","venue":null,"work_id":"bd8b26da-6f32-4797-b8cd-4828fe6f5cac","year":2019},"citing_paper":{"arxiv_id":"2507.02271","last_updated":"2025-07-03T03:23:11Z","snapshot_observed_at":"2026-08-15T02:31:19.643299Z","submitted_at":"2025-07-03T03:23:11Z","title":"Spotlighting Partially Visible Cinematic Language for Video-to-Audio Generation via Self-distillation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T20:37:19.155163Z"},"links":{"citing_paper":"/paper/2507.02271"},"observation_digest":"sha256:d77ca8ed0985109a726583f759b9ddf9d9f39fdcd58173e323e9c45b798d3672","observation_id":"8a4a7f3c-41ba-4ec9-ba7c-be28db54ae05","resolution":{"observed_at":"2026-08-06T20:37:20.670457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:37:20.362380Z","title":"Self- supervised scene de-occlusion","venue":null,"work_id":"43e4c685-3951-4556-8295-b90cfb3a385e","year":2020},"citing_paper":{"arxiv_id":"2507.02271","last_updated":"2025-07-03T03:23:11Z","snapshot_observed_at":"2026-08-15T02:31:19.643299Z","submitted_at":"2025-07-03T03:23:11Z","title":"Spotlighting Partially Visible Cinematic Language for Video-to-Audio Generation via Self-distillation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T20:37:19.278087Z"},"links":{"citing_paper":"/paper/2507.02271"},"observation_digest":"sha256:153aab9e41464cec3aeb601f3eff709b1a0e36c8977ad6f8e1538708a4486adf","observation_id":"13c81013-ec80-41f2-98a5-f4b191318ce7","resolution":{"observed_at":"2026-08-06T20:37:20.436510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:37:20.147331Z","title":"Be your own teacher: Improve the performance of convolutional neural networks via self distillation","venue":null,"work_id":"a12c43b2-02e9-4c6e-9608-b1e1cceb1c29","year":2019},"citing_paper":{"arxiv_id":"2507.02271","last_updated":"2025-07-03T03:23:11Z","snapshot_observed_at":"2026-08-15T02:31:19.643299Z","submitted_at":"2025-07-03T03:23:11Z","title":"Spotlighting Partially Visible Cinematic Language for Video-to-Audio Generation via Self-distillation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:37:19.379719Z"},"links":{"citing_paper":"/paper/2507.02271"},"observation_digest":"sha256:6aa29761328e4c528d0d0fa3d991cc979ee4e51815cc2d7735c135a0e820f00e","observation_id":"7a4233b5-94f2-40d4-acc6-21b953d901bb","resolution":{"observed_at":"2026-08-06T20:37:20.232725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01494","last_updated":"2024-07-01T17:35:56Z","snapshot_observed_at":"2026-08-12T23:31:04.494652Z","submitted_at":"2024-07-01T17:35:56Z","title":"FoleyCrafter: Bring Silent Videos to Life with Lifelike and Synchronized Sounds","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01494","snapshot_observed_at":"2026-08-06T20:37:19.460025Z","title":"Foleycrafter: Bring silent videos to life with lifelike and synchronized sounds","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02271","last_updated":"2025-07-03T03:23:11Z","snapshot_observed_at":"2026-08-15T02:31:19.643299Z","submitted_at":"2025-07-03T03:23:11Z","title":"Spotlighting Partially Visible Cinematic Language for Video-to-Audio Generation via Self-distillation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T20:37:19.460025Z"},"links":{"cited_paper":"/paper/2407.01494","citing_paper":"/paper/2507.02271"},"observation_digest":"sha256:c0db369a6e99495463cc589c5cb5fa5955018f75b7342e9b64a1fc6df9df38dc","observation_id":"1c65f088-3fe7-4bc2-9256-114872a13097","resolution":{"observed_at":"2026-08-06T20:37:19.460025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:37:19.960266Z","title":"Human orientation estimation un- der partial observation","venue":null,"work_id":"9c37f2cb-b0ec-4cc0-9b06-ea24db71da8b","year":2024},"citing_paper":{"arxiv_id":"2507.02271","last_updated":"2025-07-03T03:23:11Z","snapshot_observed_at":"2026-08-15T02:31:19.643299Z","submitted_at":"2025-07-03T03:23:11Z","title":"Spotlighting Partially Visible Cinematic Language for Video-to-Audio Generation via Self-distillation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T20:37:19.556189Z"},"links":{"citing_paper":"/paper/2507.02271"},"observation_digest":"sha256:3d369f3aaa5eea7152a7d963248246b7bd77fa412db8c9c4ca178954db6ce9f1","observation_id":"990972e0-a7ab-4afc-afc2-e81b7f28873e","resolution":{"observed_at":"2026-08-06T20:37:20.056340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:37:19.803351Z","title":"Knowledge distillation by on-the-fly native ensemble","venue":null,"work_id":"bc8ca737-fc43-4d45-a1ae-1593137f61bc","year":2018},"citing_paper":{"arxiv_id":"2507.02271","last_updated":"2025-07-03T03:23:11Z","snapshot_observed_at":"2026-08-15T02:31:19.643299Z","submitted_at":"2025-07-03T03:23:11Z","title":"Spotlighting Partially Visible Cinematic Language for Video-to-Audio Generation via Self-distillation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T20:37:19.640172Z"},"links":{"citing_paper":"/paper/2507.02271"},"observation_digest":"sha256:90ec17c065845a69d2cc2182ee22429abf2d38d82b1deb38bf08721d92f56c8d","observation_id":"085339fe-e831-4b9d-8a2b-553feb5cd84a","resolution":{"observed_at":"2026-08-06T20:37:19.890122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:37:24.143620Z","title":"Vggsound: A large-scale audio-visual dataset","venue":null,"work_id":"afc02b8d-53f3-4f80-b44c-808ade63206b","year":2020},"citing_paper":{"arxiv_id":"2507.02271","last_updated":"2025-07-03T03:23:11Z","snapshot_observed_at":"2026-08-15T02:31:19.643299Z","submitted_at":"2025-07-03T03:23:11Z","title":"Spotlighting Partially Visible Cinematic Language for Video-to-Audio Generation via Self-distillation","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-06T20:37:16.196262Z"},"links":{"citing_paper":"/paper/2507.02271"},"observation_digest":"sha256:2c7cb02f3fe010fb4b4dbbc27b059e6789838e09c54fd6ef4cc95d3b46a03f86","observation_id":"4e6e21e1-ceb6-42c3-861e-f6b90451c68a","resolution":{"observed_at":"2026-08-06T20:37:24.274677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-06T20:37:16.946712Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02271","last_updated":"2025-07-03T03:23:11Z","snapshot_observed_at":"2026-08-15T02:31:19.643299Z","submitted_at":"2025-07-03T03:23:11Z","title":"Spotlighting Partially Visible Cinematic Language for Video-to-Audio Generation via Self-distillation","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-06T20:37:16.946712Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2507.02271"},"observation_digest":"sha256:3c6c49ce1a4049670014e4c7ba4c4134f9d869b1db78c70f89cd7fe892fe6400","observation_id":"ec3772c3-aca5-4cc1-9ee4-a98870fc188b","resolution":{"observed_at":"2026-08-06T20:37:16.946712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-08-14T22:57:08.956233Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-06T20:37:16.868550Z","title":"Distilling the knowledge in a neural network","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.02271","last_updated":"2025-07-03T03:23:11Z","snapshot_observed_at":"2026-08-15T02:31:19.643299Z","submitted_at":"2025-07-03T03:23:11Z","title":"Spotlighting Partially Visible Cinematic Language for Video-to-Audio Generation via Self-distillation","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-06T20:37:16.868550Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2507.02271"},"observation_digest":"sha256:ceb12f18c92668174da8c8d9c0ff5a70fa93b23977d46b4c106c6594f9def1a3","observation_id":"60093ecc-6da4-4ccd-9ebf-89a2145e40ac","resolution":{"observed_at":"2026-08-06T20:37:16.868550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:37:23.050075Z","title":"Taming visually guided sound generation","venue":null,"work_id":"8b5e4430-f455-44e4-ac78-ab593b7a029a","year":2021},"citing_paper":{"arxiv_id":"2507.02271","last_updated":"2025-07-03T03:23:11Z","snapshot_observed_at":"2026-08-15T02:31:19.643299Z","submitted_at":"2025-07-03T03:23:11Z","title":"Spotlighting Partially Visible Cinematic Language for Video-to-Audio Generation via Self-distillation","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T20:37:17.144015Z"},"links":{"citing_paper":"/paper/2507.02271"},"observation_digest":"sha256:8af9cf9b0d6f5ea2c794d2fd813060f2d8f3e167be8353af90c883da39c46cce","observation_id":"e812d4d2-3a71-4312-be93-55647037a939","resolution":{"observed_at":"2026-08-06T20:37:23.118610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:37:21.911998Z","title":"Pose-guided feature alignment for occluded person re-identification","venue":null,"work_id":"60db6973-ef00-43e1-8a72-b5a166251f05","year":2019},"citing_paper":{"arxiv_id":"2507.02271","last_updated":"2025-07-03T03:23:11Z","snapshot_observed_at":"2026-08-15T02:31:19.643299Z","submitted_at":"2025-07-03T03:23:11Z","title":"Spotlighting Partially Visible Cinematic Language for Video-to-Audio Generation via Self-distillation","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T20:37:18.081047Z"},"links":{"citing_paper":"/paper/2507.02271"},"observation_digest":"sha256:f3ceea4f3c2949fa4e64debdf315db67f59c11dc6689b532da38d206325da16a","observation_id":"1d3a90e3-5301-4b14-9610-8063bbac5269","resolution":{"observed_at":"2026-08-06T20:37:21.977775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:37:23.982992Z","title":"Diffusion models beat gans on image synthe- sis","venue":null,"work_id":"0a53e091-bad4-4fe7-adc7-4a8bccb58de1","year":2021},"citing_paper":{"arxiv_id":"2507.02271","last_updated":"2025-07-03T03:23:11Z","snapshot_observed_at":"2026-08-15T02:31:19.643299Z","submitted_at":"2025-07-03T03:23:11Z","title":"Spotlighting Partially Visible Cinematic Language for Video-to-Audio Generation via Self-distillation","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T20:37:16.299487Z"},"links":{"citing_paper":"/paper/2507.02271"},"observation_digest":"sha256:0d65983b4138643931c83bdbed29f9110381f06e709156597d9741f0eb2041db","observation_id":"73dbc52d-bd2e-4109-872d-1649253d7afb","resolution":{"observed_at":"2026-08-06T20:37:24.073656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:37:23.847100Z","title":"Motion-aware contrastive video rep- resentation learning via foreground-background merging","venue":null,"work_id":"883d2182-5f1c-442d-99ed-7ff55a8d76f9","year":2022},"citing_paper":{"arxiv_id":"2507.02271","last_updated":"2025-07-03T03:23:11Z","snapshot_observed_at":"2026-08-15T02:31:19.643299Z","submitted_at":"2025-07-03T03:23:11Z","title":"Spotlighting Partially Visible Cinematic Language for Video-to-Audio Generation via Self-distillation","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T20:37:16.385530Z"},"links":{"citing_paper":"/paper/2507.02271"},"observation_digest":"sha256:b0cb7935dfb644a3cd1710b3d30d9fec5071b5a4457d6fe69bdf83725c80f1f7","observation_id":"943e0a8e-ed34-4e15-b066-937d0624c7e3","resolution":{"observed_at":"2026-08-06T20:37:23.904541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:37:23.703526Z","title":"Conditional gener- ation of audio from video via foley analogies","venue":null,"work_id":"2c165940-659b-42f7-9129-faef4c4726db","year":2023},"citing_paper":{"arxiv_id":"2507.02271","last_updated":"2025-07-03T03:23:11Z","snapshot_observed_at":"2026-08-15T02:31:19.643299Z","submitted_at":"2025-07-03T03:23:11Z","title":"Spotlighting Partially Visible Cinematic Language for Video-to-Audio Generation via Self-distillation","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T20:37:16.459442Z"},"links":{"citing_paper":"/paper/2507.02271"},"observation_digest":"sha256:9be345ca413e917c087d78251ea841692a7563b15e886605f9132e4ec6ad28ce","observation_id":"58f6c621-ff98-454b-abce-0de6cd318e58","resolution":{"observed_at":"2026-08-06T20:37:23.778413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:37:23.541274Z","title":"Learn2augment: learning to composite videos for data augmentation in ac- tion recognition","venue":null,"work_id":"9fef753c-c370-4a01-ac43-72d4ce1ad4ad","year":2022},"citing_paper":{"arxiv_id":"2507.02271","last_updated":"2025-07-03T03:23:11Z","snapshot_observed_at":"2026-08-15T02:31:19.643299Z","submitted_at":"2025-07-03T03:23:11Z","title":"Spotlighting Partially Visible Cinematic Language for Video-to-Audio Generation via Self-distillation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T20:37:16.563519Z"},"links":{"citing_paper":"/paper/2507.02271"},"observation_digest":"sha256:209250199a2043c55efde878acf80e2c35158c739b038fc17ef96bfa73a4e2d0","observation_id":"aaedeca7-da18-4389-996e-139a69818b1f","resolution":{"observed_at":"2026-08-06T20:37:23.603245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:37:22.891475Z","title":"Instance-wise occlusion and depth orders in natural scenes","venue":null,"work_id":"af7cbe34-ee7d-496e-8467-1e873890299d","year":2022},"citing_paper":{"arxiv_id":"2507.02271","last_updated":"2025-07-03T03:23:11Z","snapshot_observed_at":"2026-08-15T02:31:19.643299Z","submitted_at":"2025-07-03T03:23:11Z","title":"Spotlighting Partially Visible Cinematic Language for Video-to-Audio Generation via Self-distillation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T20:37:17.406906Z"},"links":{"citing_paper":"/paper/2507.02271"},"observation_digest":"sha256:8ff05f9bbb73ad658ca945f32d4f33c1e768103cf03fad2c1a726566568ecbe5","observation_id":"9cfa774b-c41b-4853-96fb-8a535021a89f","resolution":{"observed_at":"2026-08-06T20:37:22.986685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.08601","last_updated":"2025-03-24T04:00:01Z","snapshot_observed_at":"2026-08-12T22:45:43.619281Z","submitted_at":"2024-09-13T07:31:44Z","title":"STA-V2A: Video-to-Audio Generation with Semantic and Temporal Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.08601","snapshot_observed_at":"2026-08-06T20:37:18.302787Z","title":"Sta-v2a: Video- to-audio generation with semantic and temporal align- ment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02271","last_updated":"2025-07-03T03:23:11Z","snapshot_observed_at":"2026-08-15T02:31:19.643299Z","submitted_at":"2025-07-03T03:23:11Z","title":"Spotlighting Partially Visible Cinematic Language for Video-to-Audio Generation via Self-distillation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T20:37:18.302787Z"},"links":{"cited_paper":"/paper/2409.08601","citing_paper":"/paper/2507.02271"},"observation_digest":"sha256:83b30ba0ae798500ec86167acf3ba4e83e324345fbe2ab9ba36e7af0229903e4","observation_id":"bcfd0b05-4dc7-41cc-801b-84536be8fcc6","resolution":{"observed_at":"2026-08-06T20:37:18.302787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.02271","last_updated":"2025-07-03T03:23:11Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T02:31:19.643299Z","submitted_at":"2025-07-03T03:23:11Z","title":"Spotlighting Partially Visible Cinematic Language for Video-to-Audio Generation via Self-distillation"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":27},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 0 inbound Pith citation observations for arXiv:2507.02271."}