{"as_of":"2026-08-10T20:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4bb9376fe3193c89c74de40a711dec870e18c957804acc2903261056086132ba","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:58:02.357429Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:58:02.208194Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T05:58:02.433864Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-10T16:58:36.607547Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"cited_work":{"arxiv_id":"2506.06537","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.06537","snapshot_observed_at":"2026-08-07T05:58:02.433864Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","venue":"cs.CV","work_id":"e9b5cd7d-b60b-4104-ad05-74b3a5642fa5","year":2025},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-10T16:58:36.607547Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.208194Z"},"links":{"cited_paper":"/paper/2506.06537","citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:f5573deb46e39bfb02f408729902f960ab35391f2b39c6884e2cb3283643c954","observation_id":"5b467b46-f159-4823-b8ab-669a8d04bc28","resolution":{"observed_at":"2026-08-07T05:58:02.440658Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.06537/citation-record","integrity":"/paper/2506.06537/integrity","json":"/paper/2506.06537/citation-record.json","paper":"/paper/2506.06537"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:03.133298Z","title":"This capability is essential for applica- tions in video understanding, surveillance, human-computer in- teraction, and autonomous systems","venue":null,"work_id":"a0699deb-0eea-4913-8613-69d5cceb9196","year":null},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-10T16:58:36.607547Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.197732Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:2d80240459f5f98c54dad6e32c8d4c6393e1f8cece03ca21c4aa7fbf8de92fc9","observation_id":"9c324de4-f448-45d4-9973-c134069f57ec","resolution":{"observed_at":"2026-08-07T05:58:03.137883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:03.119575Z","title":"Many approaches leverage cross-modal attention [1, 2, 3] combined with contrastive learning [4, 5] to align audio and visual features","venue":null,"work_id":"3bc6f366-cd45-4ee1-b502-128a876ff834","year":null},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-10T16:58:36.607547Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.203606Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:b708292621236f07be518e834caa09e97c2e4a1ca1ee72ef8929dd996b97bffb","observation_id":"ba2b96cc-0daf-4343-abb5-a88b9eeb2afc","resolution":{"observed_at":"2026-08-07T05:58:03.124094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-10T16:58:36.607547Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"cited_work":{"arxiv_id":"2506.06537","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.06537","snapshot_observed_at":"2026-08-07T05:58:02.433864Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","venue":"cs.CV","work_id":"e9b5cd7d-b60b-4104-ad05-74b3a5642fa5","year":2025},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-10T16:58:36.607547Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.208194Z"},"links":{"cited_paper":"/paper/2506.06537","citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:f5573deb46e39bfb02f408729902f960ab35391f2b39c6884e2cb3283643c954","observation_id":"5b467b46-f159-4823-b8ab-669a8d04bc28","resolution":{"observed_at":"2026-08-07T05:58:02.440658Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:03.105935Z","title":"Models Below, we elaborate on the final models built for each approach","venue":null,"work_id":"35f005e8-aa82-41bc-bc07-e85cc6c97c17","year":null},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-10T16:58:36.607547Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.213087Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:51203eb5e8c48337ce6cc4565ab88ce2e6df732ef24c3712f6f31c03c398777f","observation_id":"05360814-6668-4846-b41d-7cdc1d1a6efe","resolution":{"observed_at":"2026-08-07T05:58:03.110256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:03.092115Z","title":"By systematically integrating audio, vision, and text representations, we bridge modality gaps and achieve fine-grained segmentation without requiring A VS-specific annotations","venue":null,"work_id":"1d7fdb9b-154c-4360-8662-6f825ca4d60e","year":null},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-10T16:58:36.607547Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.218012Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:21697d66a0a9b41a4b1c831a2997c614e6f3c14dcc90d98b7b2e3605cfa81e80","observation_id":"7266a948-ce5a-4a2f-97ae-f12a5361c794","resolution":{"observed_at":"2026-08-07T05:58:03.096865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:03.078961Z","title":null,"venue":null,"work_id":"39c47dac-1765-46a3-8b43-79ad233ee0cf","year":2025},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-10T16:58:36.607547Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.222340Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:1765bb77e9b706933a9d88d820bc3cddbdcbd8728ffaf121f4d6cf3e587ea9ff","observation_id":"45b681cf-81c4-47a9-8c43-0945a0339f6f","resolution":{"observed_at":"2026-08-07T05:58:03.083300Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:03.065839Z","title":"Learning to localize sound sources in visual scenes: Analysis and applications,","venue":null,"work_id":"b7602887-9f58-412c-923b-f05f1cc615cf","year":2019},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-10T16:58:36.607547Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.227428Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:6a9dafa79a715a265c91fb4c63a66721d1b05d2b198964349c52988a42875440","observation_id":"51b6b9a9-a56e-40c4-a262-d9929e24d7fe","resolution":{"observed_at":"2026-08-07T05:58:03.069950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13676","last_updated":"2024-07-18T16:51:15Z","snapshot_observed_at":"2026-07-06T18:48:37.723242Z","submitted_at":"2024-07-18T16:51:15Z","title":"Aligning Sight and Sound: Advanced Sound Source Localization Through Audio-Visual Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13676","snapshot_observed_at":"2026-08-07T05:58:02.231835Z","title":"Aligning sight and sound: Advanced sound source localization through audio-visual alignment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-10T16:58:36.607547Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.231835Z"},"links":{"cited_paper":"/paper/2407.13676","citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:ec080892a92b2f74e70c2da5ae3ac2869a96c8819054d5e3ce89b7888e6942f9","observation_id":"dbc8d8e5-6e64-4c80-844f-d0602e249a49","resolution":{"observed_at":"2026-08-07T05:58:02.231835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:03.053363Z","title":"Exploiting transformation in- variance and equivariance for self-supervised sound localisation,","venue":null,"work_id":"1e7620a5-cce1-48f4-bd97-32337c7b3a37","year":2022},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-10T16:58:36.607547Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.236552Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:47a95cd7053764e748396725ed612dafc1e9d60f97690fcfb073f119edbcb68d","observation_id":"ea2187a2-3ab3-4113-9ef0-27d3b535398a","resolution":{"observed_at":"2026-08-07T05:58:03.057441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:03.040730Z","title":"Localizing visual sounds the easy way,","venue":null,"work_id":"859717be-7640-40a0-b360-21b3038ba6aa","year":2022},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-10T16:58:36.607547Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.241086Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:f428f5ed4a33224469d92bacfae35c071454398398e2a465bd2e2712dcf2ce1b","observation_id":"61908570-0221-42fd-89a2-e50426373aeb","resolution":{"observed_at":"2026-08-07T05:58:03.044572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:03.028351Z","title":"Localizing visual sounds the hard way,","venue":null,"work_id":"54250634-f2e9-47d1-b9d3-ce3c766f1982","year":2021},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-10T16:58:36.607547Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.246202Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:575191ba4751f78f71aa5c4da7f13020c2a1af2309915f8e51fdd95ca02e082f","observation_id":"187b50d7-1b94-47c1-a2b1-a173a5565f20","resolution":{"observed_at":"2026-08-07T05:58:03.032265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:03.015753Z","title":"Learning audio-visual source local- ization via false negative aware contrastive learning,","venue":null,"work_id":"82f9ebf1-d083-4204-a1e1-6ad24d3f62d8","year":2023},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-10T16:58:36.607547Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.250492Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:1a954ab1f8db05fcb479616378459eb39aaf948b415315ad55e8b88d8eb1a971","observation_id":"8330852f-ff89-4c02-b9ba-acd7124ae7d0","resolution":{"observed_at":"2026-08-07T05:58:03.019857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:03.002914Z","title":"Marginnce: Robust sound localization with a negative margin,","venue":null,"work_id":"d0064e18-2729-4837-8dbc-fb8c49cffcaf","year":2023},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-10T16:58:36.607547Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.255202Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:99430a9f3cc4e823b0c9ed0830e72fa6818a219a738b7f14d63b11cc504248de","observation_id":"fe06a59f-5fdb-47ab-a449-d45ab740654f","resolution":{"observed_at":"2026-08-07T05:58:03.006909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:02.990517Z","title":"Audio–visual segmen- tation,","venue":null,"work_id":"3f057844-97e0-49bc-a7af-8fff1b2d6274","year":2022},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-10T16:58:36.607547Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.259409Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:4271dea4937634c85373a143307fe3faba85716e7ffc1c09c3d488e26497df4f","observation_id":"c2d24cae-a9bd-49af-86f2-29dc969e99db","resolution":{"observed_at":"2026-08-07T05:58:02.994261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:02.977388Z","title":"Improving audio-visual segmentation with bidirectional generation,","venue":null,"work_id":"f3806f8a-e9e0-471d-8431-4ee14d88edc5","year":2024},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-10T16:58:36.607547Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.263449Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:3b6c25f3a84d71680d77263c375a5a9d25d0514e0e296c29ee3914306de71654","observation_id":"a97a0451-fba9-402e-b8a0-3e358bed884f","resolution":{"observed_at":"2026-08-07T05:58:02.981778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:02.820392Z","title":"Selm: Selective mechanism based audio-visual segmentation,","venue":null,"work_id":"bfbf767f-d204-4816-8e3f-fa409e62c3b9","year":2024},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-10T16:58:36.607547Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.267534Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:2929936d80a7cca1e08fd8b960fd8a11c5effc05d8cfcf40e7ec0094fb657b72","observation_id":"ea52bc2d-7569-4054-80fd-e8d55ad2b4fb","resolution":{"observed_at":"2026-08-07T05:58:02.910728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:02.782628Z","title":"Bavs: Bootstrapping audio-visual segmentation by integrating foundation knowledge,","venue":null,"work_id":"33bd88bc-a246-4e4b-ac8b-4407838f0446","year":2024},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-10T16:58:36.607547Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.271953Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:5dcd03f8f9a00836f3c7501f22f2a609bb925e2fb521c2a9727e81bfe77e2094","observation_id":"110a07f7-5a14-41a5-a5a0-4d25e7cd41e2","resolution":{"observed_at":"2026-08-07T05:58:02.801448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:02.733258Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"6e23c0fb-bf30-48c3-aa5f-240a955e0587","year":2021},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-10T16:58:36.607547Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.276213Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:ccc970f666dc76936dc3bd4212833be9df218def4437edf8375cef225bbb2a13","observation_id":"b0f3a086-d99a-4b58-add1-057deb845d7d","resolution":{"observed_at":"2026-08-07T05:58:02.755960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05767","last_updated":"2024-02-06T21:42:03Z","snapshot_observed_at":"2026-08-10T11:18:27.309853Z","submitted_at":"2023-09-11T18:50:21Z","title":"Natural Language Supervision for General-Purpose Audio Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05767","snapshot_observed_at":"2026-08-07T05:58:02.280500Z","title":"Natural language supervision for general-purpose audio representations,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-10T16:58:36.607547Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.280500Z"},"links":{"cited_paper":"/paper/2309.05767","citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:486a182e59cb01366a9a5f49349cf6008dd86dcc64861000eed40442c6af4f1f","observation_id":"b97ce92b-dd08-458a-a942-8ba4a2e442af","resolution":{"observed_at":"2026-08-07T05:58:02.280500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:02.703496Z","title":"WavCaps: A ChatGPT-assisted weakly-labelled audio captioning dataset for audio-language mul- timodal research,","venue":null,"work_id":"30ce2d57-ddc6-45c2-a9d9-8248bbf7f3f3","year":2024},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-10T16:58:36.607547Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.285239Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:4ffc8dda41cfadd4c42bee8996566839dc20f09affa0914509fe078ca8c4201c","observation_id":"b957c4a4-d464-45c3-8a17-463ab759847e","resolution":{"observed_at":"2026-08-07T05:58:02.714559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:02.670231Z","title":"AudioCaps: Generating Captions for Audios in The Wild,","venue":null,"work_id":"8bfacbf1-29e2-476e-b998-56b51ed4617c","year":2019},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-10T16:58:36.607547Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.289939Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:e5bee264c9e99c7ceb20c098c868c08d7e3f3e0ac75ce223dc7ad1cd1e9f8848","observation_id":"b8a97d62-a16f-4e8d-9b2a-5cfb5cca0335","resolution":{"observed_at":"2026-08-07T05:58:02.682158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:02.636741Z","title":"Microsoft coco: Common objects in context,","venue":null,"work_id":"9245cedd-fac1-4aad-a4a0-a2d0d517632a","year":2014},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-10T16:58:36.607547Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.294346Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:8ee6fa9d46d195e632aa13e90710d980aa21929793623a16e3503c311456d654","observation_id":"5d9c8752-8a7a-40f4-a793-eda42895a494","resolution":{"observed_at":"2026-08-07T05:58:02.646312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:02.622128Z","title":"Blip: Bootstrapping language- image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":"0c623444-1665-4c89-a448-2e611e257d16","year":2022},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-10T16:58:36.607547Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.298465Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:01a7e066a6dd6331efb72362ee64ee1b35f92625fde9d8fc4e531e1b95138e3c","observation_id":"c4704ecb-6a7c-4a03-bfd6-782595e87095","resolution":{"observed_at":"2026-08-07T05:58:02.626754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01618","last_updated":"2022-08-02T17:50:36Z","snapshot_observed_at":"2026-08-02T23:40:32.342515Z","submitted_at":"2022-08-02T17:50:36Z","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01618","snapshot_observed_at":"2026-08-07T05:58:02.302544Z","title":"An image is worth one word: Personalizing text-to-image generation using textual inversion,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-10T16:58:36.607547Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.302544Z"},"links":{"cited_paper":"/paper/2208.01618","citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:19544427242bc4dfa88979385a23a0cc648bf0230bafa7d593ecbfce39b84dc4","observation_id":"3cead3a2-851f-41a0-9133-c6a0c9ce0374","resolution":{"observed_at":"2026-08-07T05:58:02.302544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:02.608397Z","title":"Learning to visually localize sound sources from mixtures without prior source knowl- edge,","venue":null,"work_id":"b046012e-1d87-4ea5-b024-c0e5c84fc861","year":2024},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-10T16:58:36.607547Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.307043Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:7f27f80d4f49c34fd877e7fe41c01fbf78cec442c227ea972c97250d49b66a0b","observation_id":"cdcf4a11-9322-438d-b2be-c3d27ffbf35f","resolution":{"observed_at":"2026-08-07T05:58:02.613063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:02.594989Z","title":"Adaptive selection based referring im- age segmentation,","venue":null,"work_id":"ee76b1f6-6b8e-48e8-9cb7-d997af106950","year":2024},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-10T16:58:36.607547Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.310995Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:0129097bb0eb8d0b55af44ecd7f95c8aae4f9cefc1ece139cb6c2b7a5bbc9ac1","observation_id":"ef3a48c4-44d5-4ca7-923b-66227211d06f","resolution":{"observed_at":"2026-08-07T05:58:02.599272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:02.581724Z","title":"Beats: Audio pre-training with acoustic tokenizers,","venue":null,"work_id":"09604cd7-2faf-4af9-877b-680ec7c071b6","year":2022},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-10T16:58:36.607547Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.315084Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:92df45eb3819cd0d7f37854837af2dc410b80de5d0796d7bd62ddcc924167c3a","observation_id":"a1d42340-6c74-4b35-a8e2-918242b51871","resolution":{"observed_at":"2026-08-07T05:58:02.585955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:02.319071Z","title":"Audio set: An ontology and human-labeled dataset for audio events,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-10T16:58:36.607547Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.319071Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:ae28b0fb36a1aa185e4b498f92e564a8a4cd407086ebd56933382a8565c65f10","observation_id":"3955a45d-4ea2-4ede-af26-ed42f347f5f7","resolution":{"observed_at":"2026-08-07T05:58:02.319071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:02.559112Z","title":"Clotho: An audio cap- tioning dataset,","venue":null,"work_id":"51144c61-56f8-4fbe-8e68-274303ced1e3","year":2020},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-10T16:58:36.607547Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.323482Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:3aa1522dcc3b91978cdf2545f9327f11d3f30bf0221ffb178fde579e65770ac5","observation_id":"7e948701-6ee2-4222-99c9-14d9ced8b76b","resolution":{"observed_at":"2026-08-07T05:58:02.563661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:02.545750Z","title":"spaCy 2: Natural language under- standing with Bloom embeddings, convolutional neural networks and incremental parsing,","venue":null,"work_id":"2caa220b-8572-407b-8776-ee63d86b9c6a","year":2017},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-10T16:58:36.607547Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.327698Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:845fa16a0c10937ed5a296e12c5201a757a1afc585ab14255ba60bfc2cef1ff7","observation_id":"809d8bfc-ead5-43fe-8513-94e268eb35f4","resolution":{"observed_at":"2026-08-07T05:58:02.550108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:02.331753Z","title":"High-resolution image synthesis with latent diffusion models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-10T16:58:36.607547Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.331753Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:da66922b5a0f7ff54aed91e8f1139b95389453b20dc66471fef7b8c0d09d733e","observation_id":"99888b15-3398-4842-943c-7ca0b879f59c","resolution":{"observed_at":"2026-08-07T05:58:02.331753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:02.522602Z","title":"Vggsound: A large-scale audio-visual dataset,","venue":null,"work_id":"b03b36dd-a732-44be-ae28-f4139dd7320f","year":2020},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-10T16:58:36.607547Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.335799Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:1559d2eb18be5abad916e579ac4c3c1964a4ebd298b63fd76159c76a7bce226f","observation_id":"406847a3-bac8-415e-b23d-bce3dce0f5e7","resolution":{"observed_at":"2026-08-07T05:58:02.526857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:02.507422Z","title":"Segment anything,","venue":null,"work_id":"a0dec9c9-c571-49aa-ad63-6115d06033a3","year":2023},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-10T16:58:36.607547Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.340053Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:6aa1df79d600882077d3189d7c144513b073433b875c7bb89a80e1038a9c7807","observation_id":"96a2c20c-d4bb-4263-b611-9c364e4e3414","resolution":{"observed_at":"2026-08-07T05:58:02.512415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:02.493288Z","title":"Unraveling instance associations: A closer look for audio-visual segmentation,","venue":null,"work_id":"64fdcb00-3850-481e-8efa-7f74b29e9d39","year":2024},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-10T16:58:36.607547Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.344260Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:a0bbd149555c86fa7ad69468f78eaea3c562191a582aaaa1e1dfa0201a13f111","observation_id":"3dec38ed-1032-4ad8-8887-aca36f518f87","resolution":{"observed_at":"2026-08-07T05:58:02.497818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:02.479438Z","title":"A closer look at weakly-supervised audio-visual source localization,","venue":null,"work_id":"6832ce68-91ba-434b-a618-d17e45a68e96","year":2022},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-10T16:58:36.607547Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.348596Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:38e6bc9b6eb55dde6b91857aa18e2d0e8004007f2b6101180850f15e89ecf583","observation_id":"005345c1-4e4b-48e5-b82e-acfb4c9df8b5","resolution":{"observed_at":"2026-08-07T05:58:02.483950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:02.464485Z","title":"Bridg- ing vision and language encoders: Parameter-efficient tuning for referring image segmentation,","venue":null,"work_id":"96c29558-c04b-41f3-930e-e3da628ff2e1","year":2023},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-10T16:58:36.607547Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.352781Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:745b0e6f8ca08bdf784104dd0f4919784b2d61248ed483e0ee64bc64eadc2d57","observation_id":"9f67a6e9-214e-4beb-8c99-694d45256cc4","resolution":{"observed_at":"2026-08-07T05:58:02.469077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:58:02.450664Z","title":"Cris: Clip-driven referring image segmentation,","venue":null,"work_id":"e9d8fffc-631f-4163-a2a9-e5fabdcb6197","year":2022},"citing_paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","snapshot_observed_at":"2026-08-10T16:58:36.607547Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:58:02.357429Z"},"links":{"citing_paper":"/paper/2506.06537"},"observation_digest":"sha256:ee429d48133dc5ca07dd3b7f5c03f5059fb16df5b21faded5ec5abab81627662","observation_id":"f16500da-de98-4eac-9740-46fc5134d510","resolution":{"observed_at":"2026-08-07T05:58:02.455112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.06537","last_updated":"2025-06-06T21:06:35Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T16:58:36.607547Z","submitted_at":"2025-06-06T21:06:35Z","title":"Bridging Audio and Vision: Zero-Shot Audiovisual Segmentation by Connecting Pretrained Models"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":1,"verified_fuzzy":30},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 1 inbound Pith citation observation for arXiv:2506.06537."}