{"as_of":"2026-08-23T06:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:89c07ba0830601f8b7431157562d6bed67a4fdb4cfac2afe1d74f0eebb0af949","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:31:59.807964Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.09615/citation-record","integrity":"/paper/2505.09615/integrity","json":"/paper/2505.09615/citation-record.json","paper":"/paper/2505.09615"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-08-15T04:53:45.483331Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-15T21:31:59.133256Z","title":"Layer normalization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.133256Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:c2ff1f3cd684482af91135ab35048b298151de7cbec4cb874e058141f0d9c7e4","observation_id":"9ec27250-d849-4af4-a668-d5a767e58f35","resolution":{"observed_at":"2026-08-15T21:31:59.133256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:02.155395Z","title":"Visual scene graphs for audio source separation","venue":null,"work_id":"482bd7df-201f-48b8-b599-9d8b89e96cc6","year":2021},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.143601Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:75e31ce9d1844af2f82c2234b262989bd4a8a5afa608c7c3b0031b859f9f2c77","observation_id":"122a23f9-a735-48bd-8eac-98d5c7a863a1","resolution":{"observed_at":"2026-08-15T21:32:02.173760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:02.108791Z","title":"Learning audio-visual dynamics using scene graphs for au- dio source separation","venue":null,"work_id":"6ca0a041-e154-4af1-bb5e-b4a39ed6653f","year":2022},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.152983Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:2298b5cae143dcdf506d416a103778665b0b4bb7aa4cc83d632530255b40f4c4","observation_id":"3a04554b-f6b1-4db9-a412-a73dafb7a1c2","resolution":{"observed_at":"2026-08-15T21:32:02.132139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:02.058321Z","title":"Soundspaces: Audio-visual navigation in 3d environments","venue":null,"work_id":"b7c06303-416c-420c-937d-491b91ca38d0","year":2020},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.172888Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:e591579f5434db867e64412e4f8542ef5f233249ebd7a2cd0f63947838a49e51","observation_id":"01bcbeb9-a2ad-4f3f-b95a-0c16ff7ea937","resolution":{"observed_at":"2026-08-15T21:32:02.069914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:02.028167Z","title":"Se- mantic audio-visual navigation","venue":null,"work_id":"e6e2dbab-0c29-4ef0-9143-f42ee8d7e916","year":2021},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.183218Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:1b5c8b44907f061bd6d196d79e599bb17bc6a928b8d1aee92f9da88042e35abf","observation_id":"75d4e832-1bc9-45b7-a475-ef6cc9f86031","resolution":{"observed_at":"2026-08-15T21:32:02.035096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:01.992437Z","title":"Learning to set waypoints for audio-visual navigation","venue":null,"work_id":"5e4fad78-80d8-4b66-a645-35017ad50844","year":2021},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.195133Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:ae02bdfe2a7da401f4e0cb1b81a87dd01135a8231b6fa44393a3f51945f4457d","observation_id":"7e00efec-21d4-4918-abb5-569a616b0f46","resolution":{"observed_at":"2026-08-15T21:32:02.008540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:01.957617Z","title":"iquery: Instruments as queries for audio-visual sound separation","venue":null,"work_id":"fb27698c-a1a1-45a4-a879-d5263096336f","year":2023},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.200164Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:967b26e95eb48635d1373976dbc1d2ec477f877744cb0605fbc1de54bc7bb791","observation_id":"3bcb7c00-8c83-4b96-875d-2ff7baa9eb2c","resolution":{"observed_at":"2026-08-15T21:32:01.964867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:01.910951Z","title":"Joint-modal label denoising for weakly-supervised audio-visual video parsing","venue":null,"work_id":"9ac7e6d5-b9a7-45cc-b227-3e7fd49fc698","year":null},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.206004Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:cdabf37e32d4ce3a9d0190a9f0724ba1613ce77fdf0d42eb47d52858fb75a304","observation_id":"9af12bc2-4b01-4410-9bb8-425b9aa44a7e","resolution":{"observed_at":"2026-08-15T21:32:01.932493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:31:59.212123Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.212123Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:c721d8cba4d16c9675869aebe962c98f4b55bc58c4a2d203ce484e71256a2fce","observation_id":"49e3a0b9-753b-4b06-aa0b-60647b3887d2","resolution":{"observed_at":"2026-08-15T21:31:59.212123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:01.853284Z","title":"Revisit weakly-supervised audio-visual video parsing from the lan- guage perspective","venue":null,"work_id":"84db8adf-ec33-4fcf-a4c2-a34382208364","year":2023},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.220812Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:992e36ecf110de68116cf86f92150c08615bcd52c6dd1c2486d05da3dcd77c37","observation_id":"090619de-dd9f-46e9-b03a-c30d137e603f","resolution":{"observed_at":"2026-08-15T21:32:01.858907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:01.824141Z","title":"Col- lecting cross-modal presence-absence evidence for weakly- supervised audio-visual event perception","venue":null,"work_id":"c9e03e1d-406f-402a-bfaa-8decfddeb860","year":2023},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.229412Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:3de168ab41c1ea9a3278e643600d6576bba7a759da4025c4d66734443d899883","observation_id":"c08ac07f-28e2-4ca2-a3ee-222dd4a14819","resolution":{"observed_at":"2026-08-15T21:32:01.831909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:01.754352Z","title":"Audio set: An ontology and human- labeled dataset for audio events","venue":null,"work_id":"c439c2bf-c637-4434-ab10-cb76396b7034","year":2017},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.243269Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:3640244b4e052352f402412c46ec3751bb99a0a27e27b6d9e8ae86fa4fec40c2","observation_id":"fe254114-4723-468c-a3f6-94a658a3de52","resolution":{"observed_at":"2026-08-15T21:32:01.778052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:01.729470Z","title":"Dynamic graph representation learning for video dialog via multi-modal shuffled transformers","venue":null,"work_id":"68d40708-f900-47d8-9e03-70290748cd85","year":null},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.259637Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:183d8a6aea84c2640dd6b3789ded2b43b91485f8fea6a226091278c05c83a1f0","observation_id":"2f7b1528-1a7e-48e4-b24f-16e9d5a583dc","resolution":{"observed_at":"2026-08-15T21:32:01.736573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:01.684271Z","title":"Dense-localizing audio-visual events in untrimmed videos: A large-scale benchmark and baseline","venue":null,"work_id":"7a847cb2-da8c-4713-816e-3ade4da5c58b","year":2023},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.277061Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:9177e338a0bc8ee2f578e84651d6b0022a90c5a5aed2775e2d3510dc5eb2a0de","observation_id":"fe142bdd-512d-4679-8fc4-c6c61e38b418","resolution":{"observed_at":"2026-08-15T21:32:01.717286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:31:59.291432Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.291432Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:a824fd88c484f4930ec672d6b257f0179a88b29c3d7c09c0d72f3452692a72f7","observation_id":"68fce9a2-ea9a-41e2-b3e4-1bea7f5d9aa1","resolution":{"observed_at":"2026-08-15T21:31:59.291432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:31:59.298919Z","title":"Cnn ar- chitectures for large-scale audio classification","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.298919Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:f7dd038b9f06e157ea2744769ec77282ce5c676bd043b654cdc10ace2ca3f2a2","observation_id":"bb944c0c-1732-4e18-aa01-4b392bd883a6","resolution":{"observed_at":"2026-08-15T21:31:59.298919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:01.560760Z","title":"Mix and local- ize: Localizing sound sources in mixtures","venue":null,"work_id":"ef878524-8a0a-4fc0-8684-634af015bb07","year":2022},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.305654Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:5a01f2e9780be3093e4f74b6bdbd4eef1bafb3da45c80837c32e10152999c8e0","observation_id":"d34a55a7-ae8d-47d5-a862-11ddb19ae7c7","resolution":{"observed_at":"2026-08-15T21:32:01.568671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:01.520896Z","title":"Egocentric audio-visual object localization","venue":null,"work_id":"31c445c1-19f1-4b28-bdc7-5a31926e9de6","year":null},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.315804Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:4c2fc14e7f844eeda2058331100ee5c9c6590bbd26ef4824c634ee59afb61d8b","observation_id":"5bece086-1497-43f5-be45-5bcf098d5c53","resolution":{"observed_at":"2026-08-15T21:32:01.534997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-20T22:03:51.775198Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-15T21:31:59.332086Z","title":"The kinetics hu- man action video dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.332086Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:536f1d23b5d330934c8dc6781be5931d23279e3680d0d6f30f622219f6ad78ba","observation_id":"b951281e-da2c-40a5-8611-83f72d791519","resolution":{"observed_at":"2026-08-15T21:31:59.332086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:01.477918Z","title":"Modality-independent teachers meet weakly-supervised audio-visual event parser","venue":null,"work_id":"54e6a5e9-eecf-4fbf-b804-f8d621137b16","year":2023},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.342042Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:a125ee61f0ac9e4b2afbd68698364869a70b32f3ba30e1400c78f18398d42913","observation_id":"c27e4f5b-d117-476e-98cb-d2253818e872","resolution":{"observed_at":"2026-08-15T21:32:01.500340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:01.405578Z","title":"Learning to answer questions in dy- namic audio-visual scenarios","venue":null,"work_id":"86ff07f5-abbf-4576-b551-e5d8b2e50511","year":2022},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.347030Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:3b0a1162c2dceef4b6ea2980330d7d47dde8c68d84be8ac604eb288cfe749a29","observation_id":"6264a68f-0e20-4446-8754-edf576e16446","resolution":{"observed_at":"2026-08-15T21:32:01.421408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:01.366296Z","title":"Audio-visual segmentation via unlabeled frame exploitation","venue":null,"work_id":"4f7037f5-d9a7-4463-854e-b1694e002546","year":2024},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.363415Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:97f56eb5f6d63e46a0b1815c83f507827327ddcaa0a74c1d672627d9befc083b","observation_id":"163b6095-6b3d-4375-b49d-a4bf3743196d","resolution":{"observed_at":"2026-08-15T21:32:01.377681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:01.330959Z","title":"Decoupled weight decay regularization","venue":null,"work_id":"6483b4c6-bb30-41e2-b6de-64545005efe4","year":2019},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.368589Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:26f28b495fcc6fa50a0fbd11f7cbe0ffc45031c8a1af897ed4476426fc032102","observation_id":"1fa7b556-f9cf-4a63-867a-006f66a06aba","resolution":{"observed_at":"2026-08-15T21:32:01.342048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:01.300816Z","title":"Move2hear: Active audio-visual source separation","venue":null,"work_id":"cc33fbc3-362c-4acc-9083-a6d1e04bfa70","year":null},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.372939Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:2d1eb2846ce675112ae6d733e79662b3cede13fc753e4894104c034eb43bb1ba","observation_id":"b152b6d9-26e4-4c29-95ac-78f5b4b006da","resolution":{"observed_at":"2026-08-15T21:32:01.309656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:01.273776Z","title":"Multimodal variational auto-encoder based audio-visual segmentation","venue":null,"work_id":"d7d02440-6775-4829-81a5-85514edb3e91","year":2023},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.380749Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:8ba1fcc0296ad075622100f0bc6168b1a387a6c7354c1285c7c70ef62972eecb","observation_id":"6106a30e-c430-4c17-bd60-6fc1420bb1df","resolution":{"observed_at":"2026-08-15T21:32:01.284809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:01.246913Z","title":"Multi-modal grouping net- work for weakly-supervised audio-visual video parsing","venue":null,"work_id":"4ce6730f-1962-402c-8c78-ce95d9039d17","year":2022},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.385132Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:123be97e950e9ecadb08ce1298a9732827f0f4b4a155de5eb730b51e42f256b8","observation_id":"71eb37a7-0b4c-4dd2-9082-fb9ffd963bd8","resolution":{"observed_at":"2026-08-15T21:32:01.252579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:01.200241Z","title":"Audio-visual grouping net- work for sound localization from mixtures","venue":null,"work_id":"0d484b9d-0255-4e05-a991-8e1c91f640b1","year":2023},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.389258Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:2a1fd617bb2652b9d1f957b31095e3ee5a166a74fadc4cc37f3172087e863657","observation_id":"cdf0f1a2-e6b9-4436-a190-687c4a493698","resolution":{"observed_at":"2026-08-15T21:32:01.226954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:01.164418Z","title":"Beyond mono to binaural: Generating binaural au- dio from mono audio with depth and cross modal attention","venue":null,"work_id":"6956eb1a-83ca-47ce-8f5f-772067b4d294","year":2022},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.396275Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:2fef5fafadac5dd8bc3bb3a27addc09fc8ee1de38f6b0747103fe854d59b387f","observation_id":"3c7e0dc6-c86d-4907-b81f-5ded0880a5c6","resolution":{"observed_at":"2026-08-15T21:32:01.184770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:01.133329Z","title":"Weakly-supervised audio-visual video parsing with prototype-based pseudo-labeling","venue":null,"work_id":"4b2e8e1d-0941-45ce-a96b-8f7202342d40","year":2024},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.429483Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:2aaee69bde94c4c19a5c958b9d915cd7ddab60cb67776fad2ea1d1aba4947244","observation_id":"8dbc4278-1faa-41cd-a5c2-82859a0ea444","resolution":{"observed_at":"2026-08-15T21:32:01.147245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:01.063821Z","title":"Boosting positive seg- ments for weakly-supervised audio-visual video parsing","venue":null,"work_id":"b3272b52-cbb1-4aea-8c08-66e9c4355802","year":2023},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.434730Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:69587f008b990ba5bf448bcbf1f352a1a204b3f40c798d28f73e02a20fe290ce","observation_id":"761423ff-a33b-4083-a772-9c4c2b002f52","resolution":{"observed_at":"2026-08-15T21:32:01.090896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:01.027959Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"de9fbcea-6e53-4674-a3fa-96ee75bd9705","year":2021},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.439188Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:26f817533bd4f9f20ecbd216aeca0be5a6ebf2df858ecfda80630351c34e49d0","observation_id":"5cf628b7-382a-44c6-87fb-bd9e24f24e21","resolution":{"observed_at":"2026-08-15T21:32:01.033205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:00.988957Z","title":"Dual perspective network for audio-visual event localization","venue":null,"work_id":"d4e6cdd0-5921-4b26-8c45-265309473696","year":2022},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.468592Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:18971181611e4a91466601f195414078e6ccf16993289a35cd89c816e582020d","observation_id":"a13ecf75-1ec7-488a-a428-eb6e560ec6ff","resolution":{"observed_at":"2026-08-15T21:32:01.001001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:00.946116Z","title":"Mm-diffusion: Learning multi-modal diffusion models for joint audio and video generation","venue":null,"work_id":"ea6b2151-cde3-4e0f-909f-ea7ee20fc264","year":2023},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.475114Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:018855abb1322eaebf864642a3d452ed51363e48ef53d4063a0cac0ae08b14d4","observation_id":"67a44cfd-909c-4cb8-a67f-39f93bb07ad7","resolution":{"observed_at":"2026-08-15T21:32:00.958757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:00.914416Z","title":"Coleaf: A contrastive-collaborative learning framework for weakly supervised audio-visual video pars- ing","venue":null,"work_id":"95c60b3c-b998-47dc-8ce3-f41a8a2cbc3e","year":2024},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.496529Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:618c81e2ee616f1fd8d51ba1c3be6f4e6e1443d118615aa5a4f5485b0d89875c","observation_id":"bc626cb0-5c41-4f34-8a6b-c9f22cfa6885","resolution":{"observed_at":"2026-08-15T21:32:00.921513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:00.870907Z","title":"Sound source local- ization is all about cross-modal alignment","venue":null,"work_id":"2067e39a-03a0-449a-9ff4-8620a444f42d","year":2023},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.510634Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:a7385b8e24da5ae1b20a4994be58affef24b5bbfc467b5ff334752d35406b03c","observation_id":"b66d66a1-83f6-4cfb-95c9-a4988a96b0a8","resolution":{"observed_at":"2026-08-15T21:32:00.882516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:00.818022Z","title":"Audio-visual scene-aware dialog and reasoning using audio- visual transformers with joint student-teacher learning","venue":null,"work_id":"409da382-d5ae-49cf-8369-aa3bbc004408","year":2022},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.517011Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:175ba7bc3dc5553e089ceb138a5b0fd89bb96add6ec60ab7c097acdfd7c80b5e","observation_id":"39069cb5-3202-4f52-b530-63d8a6e60d8c","resolution":{"observed_at":"2026-08-15T21:32:00.844801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:00.767586Z","title":"Audio-visual event localization in unconstrained videos","venue":null,"work_id":"dc950937-afe6-462d-b438-6bec92d84910","year":2018},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.544863Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:5879929f706b99c638f5310f8d0ebd735b6647352a01290a67a17e2c018893cc","observation_id":"33bc6e40-3c3b-4999-bebb-2fcb21874f9a","resolution":{"observed_at":"2026-08-15T21:32:00.782620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:00.732200Z","title":"Unified mul- tisensory perception: Weakly-supervised audio-visual video parsing","venue":null,"work_id":"c4d90a42-1cd6-46d5-bacb-08f77d304d69","year":2020},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.549590Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:faee18891afa6fd440de055e3bba15aa0cf568d520054804566eea9bb00a8e7a","observation_id":"d555cb39-b25b-4639-8748-664d0ed50552","resolution":{"observed_at":"2026-08-15T21:32:00.739320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:00.698034Z","title":"Cyclic co-learning of sounding object visual grounding and sound separation","venue":null,"work_id":"a0773986-107a-4a39-b7b1-f3df9b919b22","year":2021},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.554817Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:11e90238a52d7a861dfb31d8144c6d30291a4ada5eb2f85bad2e30e53725b986","observation_id":"196cbc9c-f071-4256-ad58-fb113cd3019d","resolution":{"observed_at":"2026-08-15T21:32:00.704073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:00.641592Z","title":"A closer look at spatiotemporal convolutions for action recognition","venue":null,"work_id":"c1234222-e5b2-45de-972f-d2227f3e1fbe","year":2018},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.560734Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:4c406702ba5f62fb1aa2e3fca368789fed55e9b508640a84dbc9cb72c1aec9ec","observation_id":"b3f7fa74-d24f-4a39-9e40-e07ca16d0b9d","resolution":{"observed_at":"2026-08-15T21:32:00.649971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:00.621553Z","title":"Attention is all you need","venue":null,"work_id":"5d7f3a4f-dd00-438b-8b1d-7c0eef7555d3","year":2017},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.570161Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:04e07761543846237cc2dfc253953c2d330c33d763913086880aa8f85bb4ff4f","observation_id":"c4e3e517-544c-4018-aa24-8cbcd43df6e2","resolution":{"observed_at":"2026-08-15T21:32:00.626134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:00.594953Z","title":"Exploring heterogeneous clues for weakly-supervised audio-visual video parsing","venue":null,"work_id":"258aebb7-da92-4989-aee4-592783575078","year":null},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.575253Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:3ba5ebd5bd100e8261195c0221bbafd981b865b36f49199325eee3abde7b1545","observation_id":"edaf838b-100d-4cdd-8cbc-0d1834ba3ea9","resolution":{"observed_at":"2026-08-15T21:32:00.607326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:00.571519Z","title":"Large-scale con- trastive language-audio pretraining with feature fusion and keyword-to-caption augmentation","venue":null,"work_id":"f4192d16-e048-4dfc-bbcb-9a8e88cc53f8","year":2023},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.583316Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:e8ab9eda8e10207e289ab0f6693f1d43a0c175be4fe0f4102e76fdd0630a2477","observation_id":"45bb1053-d8b5-436f-9616-617208fbd3d7","resolution":{"observed_at":"2026-08-15T21:32:00.576855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:31:59.598988Z","title":"Seeing and hearing: Open-domain visual- audio generation with diffusion latent aligners","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.598988Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:f01a18e7e61fbc324d1fb5d5fe686253ab288f43d1e661dffea2b8ef96b73807","observation_id":"1bf0d9e2-95d8-423a-a3c6-d352f6cd8879","resolution":{"observed_at":"2026-08-15T21:31:59.598988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:00.536502Z","title":"Cooperation does matter: Exploring multi-order bilateral relations for audio- visual segmentation","venue":null,"work_id":"2f4fd5ca-f6a3-4a8a-977a-318b2fd80413","year":2024},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.646291Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:8e304f9e3f861097eb239bc4ccf4696bf1e8b3aca232023d7a56b4bc8e884adb","observation_id":"82134964-1dfc-4804-9934-d0845d4bd6a6","resolution":{"observed_at":"2026-08-15T21:32:00.542247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:00.514182Z","title":"Lavss: Location-guided audio-visual spatial audio separation","venue":null,"work_id":"8a194920-1906-49af-99c6-c8c2c915cc9d","year":2024},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.659106Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:ba1b5d4bf9a2054739420dcb9e41add5761161753f6844c1974c38d67017007c","observation_id":"0100c19c-7e21-403e-8631-718a5bdea093","resolution":{"observed_at":"2026-08-15T21:32:00.519802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:00.470266Z","title":"Catch me if you hear me: Audio-visual navigation in complex unmapped environments with moving sounds","venue":null,"work_id":"354a46fc-4fad-4b3e-ab9b-79863abcafd3","year":2023},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.665582Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:446ee5a7456532f3cdafb7faca8c79116a32f3e3840274d39922936e829a296a","observation_id":"5a19288c-a658-4258-bb17-e851198d851f","resolution":{"observed_at":"2026-08-15T21:32:00.481224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:00.452891Z","title":"Mm-pyramid: Multimodal pyramid attentional network for audio-visual event localization and video pars- ing","venue":null,"work_id":"257883d4-32c1-4b8c-bfbe-2391e3e603e7","year":2022},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.680361Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:ac9782f6a71790e5e99ca96bbdbbd1771829eb266e6170ac6183253074e644d1","observation_id":"48f0b0b8-d54c-45cc-847f-6fc3a3f72bdc","resolution":{"observed_at":"2026-08-15T21:32:00.458147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:00.432907Z","title":"Sound adversarial audio- visual navigation","venue":null,"work_id":"3d996ec9-1d4e-4afb-919c-243e7e9fd4b1","year":2022},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.687456Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:e1d44f92d9de74ff98d04a813e4ee79691a0321531e72fb6ebc5466482ed0aa1","observation_id":"00510dc9-60a4-4deb-9779-4177ba41a438","resolution":{"observed_at":"2026-08-15T21:32:00.439982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:00.403709Z","title":"Pano-avqa: Grounded audio-visual question answering on 360deg videos","venue":null,"work_id":"0362aa70-75e8-4fd7-95c9-033e3952fb59","year":2021},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.694973Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:c01e467e8735e649e142cc47e261657a7eb60d4b9392054cb13f81a71871bf2b","observation_id":"b6efe3de-7ec8-49d2-ae8f-a1293f41bc3a","resolution":{"observed_at":"2026-08-15T21:32:00.409591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:00.364552Z","title":"Positive sample propagation along the audio- visual event line","venue":null,"work_id":"76490b7f-bd1e-4eaa-a0a5-c8d6f5ae0f3d","year":2021},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.701281Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:af08b47ebd5d0830be62292814f4dd1f7afa5e3731ac48d30e0f6f559afab99e","observation_id":"a2b0b969-271b-4913-a179-57b8c7571bc8","resolution":{"observed_at":"2026-08-15T21:32:00.376580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:00.340749Z","title":"Audio–visual segmentation","venue":null,"work_id":"a776dd30-ed27-4244-9e6f-9ef9a6a031d6","year":2022},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.716403Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:5b412d0ce9bff32a2ee32128536ae32ec6d85087055b21d6a21f1e058aaac69c","observation_id":"94f99248-d5bc-4395-8011-5d55daa45612","resolution":{"observed_at":"2026-08-15T21:32:00.348668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.02344","last_updated":"2023-03-04T07:21:37Z","snapshot_observed_at":"2026-08-16T15:50:51.505984Z","submitted_at":"2023-03-04T07:21:37Z","title":"Improving Audio-Visual Video Parsing with Pseudo Visual Labels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.02344","snapshot_observed_at":"2026-08-15T21:31:59.723469Z","title":"Im- proving audio-visual video parsing with pseudo visual labels","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.723469Z"},"links":{"cited_paper":"/paper/2303.02344","citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:a6267673f2c4d22611b364402d0c160f67ccb5deeefe370d6cecaf3f9a13fc47","observation_id":"f87879e6-6f2a-495e-8bd2-0b465a6438e2","resolution":{"observed_at":"2026-08-15T21:31:59.723469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08126","last_updated":"2024-07-11T01:57:08Z","snapshot_observed_at":"2026-08-16T13:35:15.015063Z","submitted_at":"2024-07-11T01:57:08Z","title":"Label-anticipated Event Disentanglement for Audio-Visual Video Parsing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08126","snapshot_observed_at":"2026-08-15T21:31:59.735886Z","title":"Label-anticipated event dis- entanglement for audio-visual video parsing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.735886Z"},"links":{"cited_paper":"/paper/2407.08126","citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:f64fca64b4ca0ef6b185c70bf0d8f7b85c8452e3a1c6268986738c46a9631d47","observation_id":"72850119-9bc4-4d97-87de-4c4e324e65c4","resolution":{"observed_at":"2026-08-15T21:31:59.735886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:00.319740Z","title":null,"venue":null,"work_id":"b9b6872d-def2-43a2-8605-6a084fab79a3","year":null},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.743569Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:3c8b1062cd0724e3992f2dc39f1bd58560d6f6938c8d3e9e5ef6c03a9c591fbc","observation_id":"8a537a66-5792-44a6-ab2a-254b00464927","resolution":{"observed_at":"2026-08-15T21:32:00.327917Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:00.289869Z","title":"Infer- ence Time","venue":null,"work_id":"ddfca741-dfdb-40cb-91a5-24915f6303a4","year":null},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.755392Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:19d4e209604e4f10bdaeb6f4a8d6d407c16a7ebe00adca570678bdbb5fa1650f","observation_id":"4b3a8ba1-756b-41e5-a620-bff3dcf9668a","resolution":{"observed_at":"2026-08-15T21:32:00.298247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:00.266639Z","title":null,"venue":null,"work_id":"a6c26090-6ace-4eb2-847f-c74871342528","year":null},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.763712Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:729bafd96ca1d9868734a4ae8cbdbe30f3b7693a31479827a55aefccabf48a0c","observation_id":"67290ba5-3189-4ca7-b194-62dfb489fb92","resolution":{"observed_at":"2026-08-15T21:32:00.271922Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:00.245406Z","title":"CoLeaf [34] on the LLP dataset [38]","venue":null,"work_id":"48cb4e00-b910-4bc2-8428-58bc065e0ed8","year":null},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.771495Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:d439fc6ff39d1ab91c6155dc543bebc58b01712efff4aa4b58556867fce857e1","observation_id":"9c48b870-ba84-4ea8-8eec-045753a1093c","resolution":{"observed_at":"2026-08-15T21:32:00.250972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:00.221949Z","title":"CLIP and CLAP as visual and audio feature backbones","venue":null,"work_id":"52a2dec1-21c3-4dfb-828c-7a91599a2a3b","year":null},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.777320Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:baa9ff5f89c0dea852efae3efa23093c606e9963e8f86ec7fe87f868ebf1af2e","observation_id":"f81f2b27-f1a3-4e5c-b61e-95abfd2fbe03","resolution":{"observed_at":"2026-08-15T21:32:00.227161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:00.194696Z","title":"When α is adjusted, class-balanced loss re-weighting is not applied","venue":null,"work_id":"021e4922-d1b7-4c8b-9022-4c43cc639b0d","year":null},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.784903Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:f362a41dce7dccd4a2d4dcaed0af5f9668d326a78b333f8390a6724f748c5861","observation_id":"59f87c5f-b8a7-42f9-9ca2-1d80021ad4b5","resolution":{"observed_at":"2026-08-15T21:32:00.204557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:00.143200Z","title":"The scalability of UW A V","venue":null,"work_id":"224a9dd8-da88-4cae-8774-6f11db9e9386","year":null},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.795193Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:8cf517ed7926ae045853b27dcafe7f48db895cad3aeec26b9b6abd0000af2e85","observation_id":"c9fabd4b-fd37-4de4-a131-cdec963d5ac6","resolution":{"observed_at":"2026-08-15T21:32:00.153559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:00.118728Z","title":"Binary” denotes training with binary pseudo-labels. “Soft","venue":null,"work_id":"d69b57b0-b530-4a4a-9ac6-5dc37d6cabfd","year":null},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.801428Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:e709342f485c8825d1d5768d6167f7bdca9d47c2e1fd0160a6e49b7e58f1f7cc","observation_id":"02239d69-91e6-41d2-a4ce-e5836b830be4","resolution":{"observed_at":"2026-08-15T21:32:00.128379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:32:00.055263Z","title":"Figure A8 shows the same, for sample videos on the A VE dataset [37]","venue":null,"work_id":"2d16a26f-d194-4d6e-9127-d6c3da4bb954","year":null},"citing_paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T21:31:59.807964Z"},"links":{"citing_paper":"/paper/2505.09615"},"observation_digest":"sha256:783b2cca499667f0617b05c956edfbd318c3c8bd910b7370e4602a1df3fc406a","observation_id":"d1d2606a-24bb-491e-ad49-8dfcaff1a07a","resolution":{"observed_at":"2026-08-15T21:32:00.074340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.09615","last_updated":"2025-05-14T17:59:55Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T03:19:45.565447Z","submitted_at":"2025-05-14T17:59:55Z","title":"UWAV: Uncertainty-weighted Weakly-supervised Audio-Visual Video Parsing"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":53},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 0 inbound Pith citation observations for arXiv:2505.09615."}