{"as_of":"2026-08-09T19:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c0d90a42515d4d277a1033ffbcba3f465c49ee878343d1a6d383246470deb0f7","coverage":[{"denominator":86,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":86,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T13:24:31.180804Z","state":"measured"},{"denominator":86,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":86,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.20740/citation-record","integrity":"/paper/2507.20740/integrity","json":"/paper/2507.20740/citation-record.json","paper":"/paper/2507.20740"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:20.667712Z","title":"Remembering the past and imagining the future: Common and distinct neural substrates during event construction and elaboration","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:20.667712Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:557f4653d03efb8099c41be423eedf6946b01ffdef0bc4be37d19c7c7365e408","observation_id":"92232e28-b925-4df0-98d6-3cd58f3e6a75","resolution":{"observed_at":"2026-08-06T13:24:20.667712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14203","last_updated":"2024-03-21T07:56:09Z","snapshot_observed_at":"2026-08-08T12:31:37.124293Z","submitted_at":"2024-03-21T07:56:09Z","title":"Unsupervised Audio-Visual Segmentation with Modality Alignment","version":1},"cited_work":{"arxiv_id":"2403.14203","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.14203","snapshot_observed_at":"2026-08-06T13:24:32.241520Z","title":"Unsupervised Audio-Visual Segmentation with Modality Alignment","venue":"cs.CV","work_id":"72971c73-44d9-4f92-b171-6ac05ac75389","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:20.791836Z"},"links":{"cited_paper":"/paper/2403.14203","citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:6f5175bce617f913ca65ec31831ab3808490d1e11844abe3c9739a8d88f334b1","observation_id":"9eb1ad31-b9f1-4f74-96f2-1c505fd5a6b4","resolution":{"observed_at":"2026-08-06T13:24:32.277437Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:20.951174Z","title":"Numerics of gram-schmidt orthogonalization","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:20.951174Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:15b4ebfec832a682643a094a7891aae9d3b79b8230605e4fdd61fc2707d237e2","observation_id":"a94ba4dc-11e1-4712-acd0-31967afc369f","resolution":{"observed_at":"2026-08-06T13:24:20.951174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:21.092219Z","title":"Self-projection and the brain","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:21.092219Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:ab1b1ff62bde6a75f92534275b3b7432e29ced4304df11bd5da5a9102cb6888a","observation_id":"a04bf18d-2e62-4197-8c4a-71e71f82acf2","resolution":{"observed_at":"2026-08-06T13:24:21.092219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02327","last_updated":"2024-02-06T11:35:05Z","snapshot_observed_at":"2026-08-09T15:44:01.399586Z","submitted_at":"2024-02-04T03:02:35Z","title":"Bootstrapping Audio-Visual Segmentation by Strengthening Audio Cues","version":2},"cited_work":{"arxiv_id":"2402.02327","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.02327","snapshot_observed_at":"2026-08-06T13:24:32.082012Z","title":"Bootstrapping Audio-Visual Segmentation by Strengthening Audio Cues","venue":"cs.CV","work_id":"93e64cb2-65f9-43be-b99e-12e85769eecb","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:21.302100Z"},"links":{"cited_paper":"/paper/2402.02327","citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:b50cdf425eaa842b322c51738ee98dd4bba41624209974d15139748723b2f0ef","observation_id":"d1420b7c-6981-4053-8105-cf2018875008","resolution":{"observed_at":"2026-08-06T13:24:32.180551Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:21.405095Z","title":"Unraveling in- stance associations: A closer look for audio-visual segmenta- tion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:21.405095Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:7e67c4874101546064fcf9c165425b316a89b74ef8795bf37ccf13c0b2476578","observation_id":"f0f5345d-472c-470c-9d4f-604e5b30339e","resolution":{"observed_at":"2026-08-06T13:24:21.405095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:21.553958Z","title":"Cpm: Class-conditional prompting ma- chine for audio-visual segmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:21.553958Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:94446f0a334087c902ffe5aa8d067ac6177191d17e33c268fffdad50f7c1fff6","observation_id":"030edca1-1e34-4e8e-beaa-9300ac0f420a","resolution":{"observed_at":"2026-08-06T13:24:21.553958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:21.724840Z","title":"Cpm: Class-conditional prompting ma- chine for audio-visual segmentation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:21.724840Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:29a7cc2a5ee6a04b54992e18b0f1a1edd673e8e297c7bbd9c54989359ac0bc57","observation_id":"a6ea029d-b907-43e9-9046-4109dee5f372","resolution":{"observed_at":"2026-08-06T13:24:21.724840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:38.505453Z","title":"C-cam: Causal cam for weakly supervised seman- tic segmentation on medical image","venue":null,"work_id":"0231cc62-3964-4f77-bc1f-e383c9fc6692","year":2022},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:21.852776Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:ed832e6ad965332906fea5b5092e230a4e4804c42a0255bce6a7df83596487d0","observation_id":"1ce8f95b-8eaa-45d5-aea5-7067c2022032","resolution":{"observed_at":"2026-08-06T13:24:38.508793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:38.494870Z","title":"Asi- seg: Audio-driven surgical instrument segmentation with surgeon intention understanding","venue":null,"work_id":"5817c23e-2055-42f0-8996-bcad22f3f81a","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:21.943556Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:b3d13841b4a48dd86cc8e37fa9a99013c187a4737043daaff95bdb586e844120","observation_id":"c6142001-4757-44a9-bc47-8aa03bb6c9c2","resolution":{"observed_at":"2026-08-06T13:24:38.498445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:38.483919Z","title":"Regret and its avoidance: a neuroimaging study of choice behavior","venue":null,"work_id":"56dc09b3-853f-4f33-8ac2-7241e6e2dda8","year":2005},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:22.148549Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:b6a1acea3caec704680abfbb9aeeb12d22592080ac485969b5ae893322ca6dc4","observation_id":"fb8e7385-9045-4591-820f-a702f4b0b486","resolution":{"observed_at":"2026-08-06T13:24:38.487167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01618","last_updated":"2022-08-02T17:50:36Z","snapshot_observed_at":"2026-08-02T23:40:32.342515Z","submitted_at":"2022-08-02T17:50:36Z","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01618","snapshot_observed_at":"2026-08-06T13:24:22.313670Z","title":"An image is worth one word: Personalizing text-to- image generation using textual inversion","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:22.313670Z"},"links":{"cited_paper":"/paper/2208.01618","citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:86505649a87263176bcf1a4a8823620111380b0da0ffb7ecd4f39393927cc192","observation_id":"fbd22937-7218-4a6c-b92f-ef4c741c36b6","resolution":{"observed_at":"2026-08-06T13:24:22.313670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:38.473782Z","title":"Avsegformer: Audio-visual segmentation with trans- former","venue":null,"work_id":"b126b325-390e-418c-a17c-7b8aba959d92","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:22.499286Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:d6be26ca7b21046134d5f9cd426b276133664c59c0673388487eb42ba7339834","observation_id":"a1df29dc-3460-4ad4-b47e-84b0ecfdb377","resolution":{"observed_at":"2026-08-06T13:24:38.477009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:38.464663Z","title":"Open- vocabulary audio-visual semantic segmentation","venue":null,"work_id":"47ba567a-4a5a-4e35-ad66-629fbc386168","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:22.665424Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:168c476ff188b24033d1398f6e05312443d35696d91f35497617a31d7dcc5f9e","observation_id":"55ba5b81-6af3-40a3-896e-5c9ab45c8ab2","resolution":{"observed_at":"2026-08-06T13:24:38.467530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:38.455371Z","title":"Embodied intelligence via learning and evolution","venue":null,"work_id":"776276dc-d82b-4a6e-ae9f-be5672190c95","year":2021},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:22.804976Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:f7a34e16ee950e3ad323de8eb5fbab665f6649467e7fc3e0770a931226b57985","observation_id":"a40a676a-cf8a-4e3e-af99-e85fb9a9efcf","resolution":{"observed_at":"2026-08-06T13:24:38.458399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:38.445706Z","title":"Improving audio-visual segmenta- tion with bidirectional generation","venue":null,"work_id":"e43b4882-48f6-447a-8f7b-3f420f4db068","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:22.948652Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:d19f34bfe782bdf6a857aeed07969ca8d486b561812d81b4fe2ca7f234d556f0","observation_id":"7d8ebeb7-ef7a-4eca-9289-3da185fc510d","resolution":{"observed_at":"2026-08-06T13:24:38.449069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:23.073062Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:23.073062Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:061465415d4d0c2fa9d740c9a6188d7974da0d285abccd7bcf6d4a07a7595191","observation_id":"7db11bdb-d39e-4059-89d5-b0291245b940","resolution":{"observed_at":"2026-08-06T13:24:23.073062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:38.430113Z","title":"Momentum contrast for unsupervised visual rep- resentation learning","venue":null,"work_id":"fe8fe6a6-81d6-4899-89e2-7cf19fda0908","year":2020},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:23.261042Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:1bc557e174fa5fbb45a9361d2119c0077eefc3496b109fea1794e1e7ee2f4177","observation_id":"7db395b5-bece-416d-a433-19a801035327","resolution":{"observed_at":"2026-08-06T13:24:38.433031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:38.421067Z","title":"Decoupling static and hier- archical motion perception for referring video segmentation","venue":null,"work_id":"c11fca44-de6a-478d-90a9-9e31c941be71","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:23.491221Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:1539581b9cc39b0aac5212200d5c65cb7a75829dfcd4b8e742339f07fee0d6b4","observation_id":"11788e0e-e091-4466-80f6-be4069bbd29f","resolution":{"observed_at":"2026-08-06T13:24:38.424334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:38.412640Z","title":"A general mechanism for perceptual decision-making in the human brain","venue":null,"work_id":"b6f80ca5-d38d-49d9-84cb-d47a2be580f4","year":2004},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:24.452927Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:1c99ee9a8a399b55f4fd2af47df3b536738005e8e30b08f117a187df6297d3a7","observation_id":"a084624f-8829-4e51-9103-40308de46c4f","resolution":{"observed_at":"2026-08-06T13:24:38.415636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:38.403300Z","title":"Cnn archi- tectures for large-scale audio classification","venue":null,"work_id":"98ac33a7-f732-42ae-9b8f-f620507e47c0","year":2017},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:24.614224Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:7a7c54aaa5a9e84e15c8e27ee82be8ad2a5047a359823470b7a332045cb1600d","observation_id":"25d03ac9-fee1-4fbe-b4e1-10adddf4bc64","resolution":{"observed_at":"2026-08-06T13:24:38.406901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:38.394779Z","title":"Aleatory and epistemic uncertainty in prob- ability elicitation with an example from hazardous waste management","venue":null,"work_id":"ebf5cf4e-c8ca-46f0-bcfb-c873b1e2242f","year":1996},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:24.755532Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:65f930d232ea146b9232fe0f9e7bed86a5da39f94ff3584cc44cfa4b69e236eb","observation_id":"0439d45d-3416-427a-a8f1-2f5fcc1fe83e","resolution":{"observed_at":"2026-08-06T13:24:38.397744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:38.386518Z","title":"Mix and local- ize: Localizing sound sources in mixtures","venue":null,"work_id":"eebd53e1-f68a-43ef-ad74-bc275b51f41d","year":2022},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:24.860562Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:f3c919ae34315e3d8df8481959a1e3ce434f505e4ba364796b3c67f509a69ed8","observation_id":"ad0cc980-5875-4b85-8a50-691e04dbeb66","resolution":{"observed_at":"2026-08-06T13:24:38.389427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:38.377033Z","title":"Make-an-audio: Text-to-audio gen- eration with prompt-enhanced diffusion models","venue":null,"work_id":"6a983656-b60e-49f9-9e29-42cb495ae97b","year":2023},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:25.010580Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:9f99a9c53bec81c5b4386f367836320ac041aedd81bd0b7f6487ca2009afb746","observation_id":"4bd25916-ba48-4257-b022-57a94eebb045","resolution":{"observed_at":"2026-08-06T13:24:38.380217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.09501","last_updated":"2023-09-18T05:58:06Z","snapshot_observed_at":"2026-08-09T16:34:30.513409Z","submitted_at":"2023-09-18T05:58:06Z","title":"Discovering Sounding Objects by Audio Queries for Audio Visual Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.09501","snapshot_observed_at":"2026-08-06T13:24:25.169098Z","title":"Discovering sound- ing objects by audio queries for audio visual segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:25.169098Z"},"links":{"cited_paper":"/paper/2309.09501","citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:11ca3039f9c4fa9572394224418338f6e034ca0c45aecd1048deb50b945dcf73","observation_id":"22163450-fa2b-4b2c-b5fa-5ccb7264a524","resolution":{"observed_at":"2026-08-06T13:24:25.169098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:38.368022Z","title":"Adaptive mixtures of local experts.Neu- ral computation, 3(1):79–87, 1991","venue":null,"work_id":"803b046c-c5b0-477c-b8bb-c476d98fa23b","year":1991},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:25.330912Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:63b02386293fd580436be71db2275fc4cc31691ff0552e1c141a73dc5cf36711","observation_id":"68326339-9d84-4988-b9c3-9c53df2ff659","resolution":{"observed_at":"2026-08-06T13:24:38.371190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:38.359473Z","title":"Counterfactually augmented event matching for de-biased temporal sentence grounding","venue":null,"work_id":"134883f8-6236-4606-a5b8-887fe72041c3","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:25.559673Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:bb7b9bb526e77d889402ee1a2ac77c2b7044a3fd72035534809ceac8573dc214","observation_id":"6c4c9f0d-b966-4443-b3cb-2633c9986a55","resolution":{"observed_at":"2026-08-06T13:24:38.362368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:38.350557Z","title":"Learning to visually localize sound sources from mix- tures without prior source knowledge","venue":null,"work_id":"234d00d6-0717-495d-a58c-dc6f7d5e9804","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:25.728411Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:ff5a3fbb7e692da1ad72ebeaab3ffde384c9c4d5737cddc0c09a9a6752244d7a","observation_id":"993faee2-f328-4068-9126-e24260f76fb1","resolution":{"observed_at":"2026-08-06T13:24:38.353458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-08-08T05:14:59.435033Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-06T13:24:25.802594Z","title":"Segment any- thing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:25.802594Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:17661c50a5b0f7dcec65ed5772b35d2443059e66b230a789ba7f43241890af7c","observation_id":"dd417650-4dd9-4d51-b7d5-2064dcdfbd7e","resolution":{"observed_at":"2026-08-06T13:24:25.802594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:38.341810Z","title":"The singular value decompo- sition: Its computation and some applications","venue":null,"work_id":"2cd114c9-fad2-483b-a589-702338f62a24","year":1980},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:25.806450Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:e9eee67f25bdd7360e6667c5134ed989cd15d26b627703baa26a06931fd5b6eb","observation_id":"e63916f1-06da-44b1-9a0a-9fb875251c68","resolution":{"observed_at":"2026-08-06T13:24:38.344825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:38.332344Z","title":"Improving vision and language concepts understanding with multimodal counterfactual samples","venue":null,"work_id":"e7f693bc-4ddc-42f0-a0f3-e6797a5bbb01","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:25.892511Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:0aab6f382f9aadf709f73d6718edca7a921854b49a827c44a54f28424e3ceb17","observation_id":"474a0f74-f627-4521-b5f7-23d07f5141c8","resolution":{"observed_at":"2026-08-06T13:24:38.335417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:38.321696Z","title":"Selm: Selective mechanism based audio-visual segmentation","venue":null,"work_id":"c2b865dc-ba5e-43df-8795-906d71a7c2b1","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:26.058249Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:d2a0ea3b2bad712fa7a4da13511f37d2e57e7fa2673937a2aac47c4de5b2a2e0","observation_id":"408135f8-3618-45b7-bf4c-cdddf4533d7d","resolution":{"observed_at":"2026-08-06T13:24:38.325244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:38.312208Z","title":"Catr: Combinatorial-dependence audio-queried transformer for audio-visual video segmentation","venue":null,"work_id":"c24759aa-1e58-4164-b2d2-73e883e9168d","year":2023},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:26.185331Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:b4caf59339a457783bae0e369dbd0b56088749cc487d45ec991a044dc69079af","observation_id":"cb089aa7-6c78-41ad-8705-7df5c63882fe","resolution":{"observed_at":"2026-08-06T13:24:38.315333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02855","last_updated":"2026-07-29T07:55:45Z","snapshot_observed_at":"2026-08-01T23:09:00.410365Z","submitted_at":"2019-11-07T11:14:05Z","title":"Dice Loss for Data-imbalanced NLP Tasks","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.02855","snapshot_observed_at":"2026-08-06T13:24:26.309876Z","title":"Dice loss for data-imbalanced nlp tasks","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:26.309876Z"},"links":{"cited_paper":"/paper/1911.02855","citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:5a4b00099a4a983677e46f59c4f4befc2e0806167855fecf2cfb1003f836203a","observation_id":"4bda86bf-c11d-4172-9739-69e6e3a052d8","resolution":{"observed_at":"2026-08-06T13:24:26.309876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:38.231445Z","title":"Qdformer: Towards ro- bust audiovisual segmentation in complex environments with quantization-based semantic decomposition","venue":null,"work_id":"7b7a5fb6-8c0e-423c-b104-a1804d701519","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:26.423838Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:f41d388ba49481bcafdc261d2e2eb7f54baaa786809082db91edfe87a87d126b","observation_id":"dc6ce626-8fa9-44c3-8a01-d4ab5140b521","resolution":{"observed_at":"2026-08-06T13:24:38.305293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:37.978814Z","title":"Bavs: bootstrapping audio- visual segmentation by integrating foundation knowledge","venue":null,"work_id":"04cceaaa-53e1-4bee-a716-f5676ce142c2","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:26.526751Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:a1433e772c2d31b0d5699b1ee209164a9deb45964a564f0b15203e1678b465ce","observation_id":"07b5e024-bb4d-4dfc-8e01-9cb7c3ac55b4","resolution":{"observed_at":"2026-08-06T13:24:38.084022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:37.790571Z","title":"Benchmarking au- dio visual segmentation for long-untrimmed videos","venue":null,"work_id":"e356492a-6caf-48fd-94c1-9b44a6f33b5e","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:26.586204Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:9d721fc1b31b29811e1ac71de3ffd97b408315cf5a2390f0428a8372a42e2d71","observation_id":"cf977619-d618-4910-b7d3-7d9da6e76caf","resolution":{"observed_at":"2026-08-06T13:24:37.893219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:37.612786Z","title":"Pay attention to mlps","venue":null,"work_id":"a3a43941-ab90-46e4-b8f1-b07c92a8786c","year":2021},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:26.693841Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:22093b35d3f58ad728f9261c48dde8cc384e4d0e16c8246aa74e760a6c72d3dd","observation_id":"b31a92b5-bc64-4781-84c0-0900693af95b","resolution":{"observed_at":"2026-08-06T13:24:37.688252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13236","last_updated":"2023-07-25T03:59:04Z","snapshot_observed_at":"2026-07-06T15:58:08.777051Z","submitted_at":"2023-07-25T03:59:04Z","title":"Audio-aware Query-enhanced Transformer for Audio-Visual Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13236","snapshot_observed_at":"2026-08-06T13:24:26.828928Z","title":"Audio-aware query-enhanced trans- former for audio-visual segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:26.828928Z"},"links":{"cited_paper":"/paper/2307.13236","citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:36920f1a5e2b0a86c0bb8a7d6c99ff60a1fffdb15abf6d0597c922e7c684ec59","observation_id":"83406f5f-7bb9-4ab9-8444-f8fed48f887d","resolution":{"observed_at":"2026-08-06T13:24:26.828928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11019","last_updated":"2023-10-07T07:57:15Z","snapshot_observed_at":"2026-08-02T11:10:26.756993Z","submitted_at":"2023-05-18T14:52:45Z","title":"Annotation-free Audio-Visual Segmentation","version":4},"cited_work":{"arxiv_id":"2305.11019","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.11019","snapshot_observed_at":"2026-08-06T13:24:31.854076Z","title":"Annotation-free Audio-Visual Segmentation","venue":"cs.CV","work_id":"4868945c-be34-42b5-a3f6-8c9a9bd1a2e9","year":2023},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:26.936793Z"},"links":{"cited_paper":"/paper/2305.11019","citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:567a092d4933ce23fc4dae5b3defc4229959609df25154bd7de94dcc23ddf901","observation_id":"2c8f30a5-6a29-4d72-bdfd-1edacc700458","resolution":{"observed_at":"2026-08-06T13:24:31.926622Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:37.425882Z","title":"Audio-visual segmentation via unlabeled frame exploitation","venue":null,"work_id":"a16772d6-2d25-4f98-aba7-11faa1a12400","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:27.047524Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:778faef15f6a6bd6c93b52e64c150fbbd285d35348f4019ab8546b8b706c7905","observation_id":"625ce05b-28ab-495a-b273-91ed366358e5","resolution":{"observed_at":"2026-08-06T13:24:37.518602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:37.169935Z","title":"Cross-modal causal relational reasoning for event-level visual question answer- ing","venue":null,"work_id":"cdff6539-a71b-4d7d-8b64-a1f28d0b970d","year":2023},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:27.109504Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:0c245aec9dcc4c5dcb3ae764a8ec6a6fa315b933c1f6f6ff9bb4edce9b6cb60c","observation_id":"c7579be3-fa9c-49a3-be3a-10f786024ce9","resolution":{"observed_at":"2026-08-06T13:24:37.282649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:27.197551Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:27.197551Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:07003cfa1dc2c43fab3804325841a1d624b9540210660d4be0565688a49a55a9","observation_id":"a06da19b-3e21-4ffb-b1d3-ac841e088740","resolution":{"observed_at":"2026-08-06T13:24:27.197551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:37.058775Z","title":"Step- ping stones: a progressive training strategy for audio-visual semantic segmentation","venue":null,"work_id":"32ed0636-3ec3-49e7-9c0c-3432205f01a6","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:27.320757Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:795798d000300155e96017b771fc8d6ec00f3c5d3b5ef86bceb78ccc81da1da1","observation_id":"13a86cc8-f036-4e73-9a36-d75679152aaa","resolution":{"observed_at":"2026-08-06T13:24:37.131875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:36.910051Z","title":"T-vsl: Text-guided visual sound source localization in mixtures","venue":null,"work_id":"0527fc37-e6c6-4e2c-b50b-b7b5093f93ee","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:27.386920Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:ef144e5ed7c449d650b90fabcd3c1d30d0c32408d53610eb12492cedf37ebb7d","observation_id":"b64d31e0-fc4b-46aa-a4d2-719d938986bf","resolution":{"observed_at":"2026-08-06T13:24:36.993803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16579","last_updated":"2025-07-01T05:44:57Z","snapshot_observed_at":"2026-08-01T16:34:42.779898Z","submitted_at":"2023-07-31T11:29:50Z","title":"Contrastive Conditional Latent Diffusion for Audio-visual Segmentation","version":2},"cited_work":{"arxiv_id":"2307.16579","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.16579","snapshot_observed_at":"2026-08-06T13:24:31.703852Z","title":"Contrastive Conditional Latent Diffusion for Audio-visual Segmentation","venue":"cs.CV","work_id":"e2fb4410-4e8b-44fc-8fa7-e08f40beab92","year":2023},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:27.507201Z"},"links":{"cited_paper":"/paper/2307.16579","citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:61015cb7f0442ad9a1071c0775d167b6db25621985aa5279dae91a8126f1262b","observation_id":"076f56ba-c832-4b60-b184-fb3d02046c3e","resolution":{"observed_at":"2026-08-06T13:24:31.766124Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:36.779918Z","title":"Multimodal variational auto-encoder based audio-visual segmentation","venue":null,"work_id":"d9310847-b8e8-4b3e-a39c-8544ab16ea05","year":2023},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:27.623102Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:04a92dbfb3bba38570155b0c488488e75e9bddd33aacafdf78147ac86eb1f469","observation_id":"055e248f-983a-45a3-8192-908b2a38d400","resolution":{"observed_at":"2026-08-06T13:24:36.818435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:27.707306Z","title":"Weakly-supervised audio- visual segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:27.707306Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:fc2427d60222b7728dbf20ee97aa83949e2960b3ac9347fa01ac296f961e2654","observation_id":"6bd68199-fb71-4bcd-95f9-262304aef98b","resolution":{"observed_at":"2026-08-06T13:24:27.707306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:36.600377Z","title":"Audio-visual grouping net- work for sound localization from mixtures","venue":null,"work_id":"71aa0401-2696-4d84-89d3-f36bbc0deabc","year":2023},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:27.831618Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:a928f1451a6ab2ba4ba5cf37a7aa72b33889da96f6eb946a493fcfda017dc5e9","observation_id":"679f4081-6369-4b62-8236-66eb37155659","resolution":{"observed_at":"2026-08-06T13:24:36.647904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:36.469318Z","title":"The book of why: the new science of cause and effect","venue":null,"work_id":"124cd9e9-d5a1-4297-bed3-799e1ce1a3cc","year":2018},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:27.932310Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:a90667afb50f0f2a979a28d5607b2c4334f86912b8c3758679d3b874c58a5b36","observation_id":"b1a01a9e-85cd-4fce-8f44-da6ae9d201d1","resolution":{"observed_at":"2026-08-06T13:24:36.501190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:28.047650Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:28.047650Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:9a5b883e5898afaede56d9bf04c2ef1040b1a69e7dd979ecb54632d1a493de0b","observation_id":"bcabcb0c-4af6-402f-ac10-adf0ba432cfd","resolution":{"observed_at":"2026-08-06T13:24:28.047650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:28.155249Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:28.155249Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:0636565bc9ae20109df0007ed0c06c55d6d74116a7b176db11bb6a1bc3fea6a8","observation_id":"550e563d-bb74-48bb-8da8-98f2af648330","resolution":{"observed_at":"2026-08-06T13:24:28.155249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:36.331046Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"f24f48f4-d7c9-4acb-991c-f2393610e3f3","year":2022},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:28.258287Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:734a54f318e9c7525511dc8f4eaed0efaf1e0fb6399bc50dd15641aae6d805f2","observation_id":"a0617c11-9af7-4ca2-aed7-99a53b509b4b","resolution":{"observed_at":"2026-08-06T13:24:36.393079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:28.331897Z","title":"Focal loss for dense ob- ject detection","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:28.331897Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:5eb1ff7a454127e5e5a9e0cb085442f62a52b49351efb0d5f899ea319c209649","observation_id":"5e9251e1-5e22-4c0c-87d5-841fd30864bb","resolution":{"observed_at":"2026-08-06T13:24:28.331897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:36.163804Z","title":"The wasserstein distance and approxi- mation theorems","venue":null,"work_id":"981972b7-81d4-4854-83f8-b164ddcae17e","year":1985},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:28.439113Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:4c4dbec4f35aa7e1a58cc1380aab5241555fda7700eb359ed10fce4d50b1ee41","observation_id":"af45f266-bf12-4f4b-8d4c-88b9a904e7be","resolution":{"observed_at":"2026-08-06T13:24:36.249885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:35.988464Z","title":"Better aggregation in test-time augmentation","venue":null,"work_id":"5b5f672c-d91f-4513-ae56-63744653bac1","year":2021},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:28.519677Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:f04a4960a40a65034ab49b3050778f59e9533ccac6fb8b821c42544c8670f447","observation_id":"f7ab43a7-705a-400e-92ea-0d19b46e369c","resolution":{"observed_at":"2026-08-06T13:24:36.097862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:35.872730Z","title":"A mathematical theory of commu- nication","venue":null,"work_id":"034617b8-540a-42a2-afe7-87cec52f23a0","year":null},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:28.634597Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:fd6c4598d011b16f188e136b8c2e0579411cc4ea9dbbf5f2538f9fc6d5c80991","observation_id":"ffb19ff6-108c-4007-954d-feb8189ad7d3","resolution":{"observed_at":"2026-08-06T13:24:35.925906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:35.757020Z","title":"Looking similar sounding different: Leveraging counterfactual cross-modal pairs for audiovisual representa- tion learning","venue":null,"work_id":"f9753d7e-2207-40eb-866a-cfc2b88ca31d","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:28.704904Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:27d0c6d0e2cee381373fcb813f45041ca23d08088288e0000eabc3c17eeec3d7","observation_id":"99535a89-fd96-4c7c-bd56-9077b0df0bef","resolution":{"observed_at":"2026-08-06T13:24:35.804483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2411.02236","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:31.513729Z","title":"3d audio-visual segmentation","venue":null,"work_id":"d94fd790-daf1-4e22-a5a1-65e096564bb4","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:28.777772Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:da438d14d2788adaabaa32c632ebb043b462e451bc62c65354abfdd0881ed185","observation_id":"23110967-391c-4226-986c-db595b6da29e","resolution":{"observed_at":"2026-08-06T13:24:31.614704Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:35.640444Z","title":"Unveiling and mitigating bias in audio visual segmentation","venue":null,"work_id":"036ae61b-53f3-4a56-b1de-1dd3c902b6bc","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:28.858392Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:cb2ea0cfd9b276589725e7de3b8c2ed9024dc2be697dcb1e3ce92c5662a3fa9e","observation_id":"e2a02759-95dd-43e7-ac93-50bfdd89d177","resolution":{"observed_at":"2026-08-06T13:24:35.702149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:35.517750Z","title":"Learning audio-visual source localization via false negative aware contrastive learning","venue":null,"work_id":"08bc6d48-cf1f-451c-8a9c-e76383aafd28","year":2023},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:28.979464Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:e713ee32543153335551487e32aa82029f4e9f6ce03638e1219e584bc310312c","observation_id":"15377690-589c-47c1-8b04-87f7639ab53a","resolution":{"observed_at":"2026-08-06T13:24:35.572731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:35.319351Z","title":"Language-guided audio-visual source separation via trimodal consistency","venue":null,"work_id":"c9a61440-5c4b-4905-a695-e604d2c7b02a","year":2023},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:29.061286Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:de7b50717d9a6950e4878125722e770f2ed6147e36d5c32e64af6096eeb99100","observation_id":"2515ccf1-998f-4f4d-ac57-f3a328a0e817","resolution":{"observed_at":"2026-08-06T13:24:35.417838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T13:24:29.167740Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:29.167740Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:03ff9f1a17e14fe7ff7a71de0f2ce7cc864aec50da4fa2aa5ab67a8e634c9b63","observation_id":"0c2e86cd-6ec9-4654-a9a2-c8867e76ca0a","resolution":{"observed_at":"2026-08-06T13:24:29.167740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:35.139668Z","title":"Neural discrete representation learning","venue":null,"work_id":"5e0ee349-a031-460c-8294-e5bcbb6e7d8a","year":2017},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:29.269444Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:3d1c70b3282f1ce8fc4c197fdbf40d23d1cef5b359be4c8bc278d4cdca93c3f1","observation_id":"8a2ca42f-3d2f-4d93-a5d3-fb2d02c7faac","resolution":{"observed_at":"2026-08-06T13:24:35.232776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:34.904825Z","title":"Counterfactual cycle-consistent learn- ing for instruction following and generation in vision- language navigation","venue":null,"work_id":"a601ea1e-97d8-4f7b-8537-633905e5b8e3","year":2022},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:29.340354Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:00b7a1565298451e09b714c0ef8ead3d54aea9e80bca6d8033c474e17522420e","observation_id":"f2efaf7a-148a-4976-ac2b-eb2b10eaeb84","resolution":{"observed_at":"2026-08-06T13:24:34.985658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:34.707738Z","title":"Vision-and-language naviga- tion via causal learning","venue":null,"work_id":"914d7e42-40b9-4e62-b391-85109cdbb872","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:29.450485Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:423c31c7817e27f86473db1996f033aa0e8d8f386e997bcb7bb068e963b115e8","observation_id":"dfe75355-433d-4e55-8086-5c7bb61ea5b4","resolution":{"observed_at":"2026-08-06T13:24:34.817968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T13:24:29.575827Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:29.575827Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:f4c693c152df88b26848ee9777fbf47f213643fb592acca63e0d4b02391036bf","observation_id":"6b0363dd-d240-4a07-b11c-99257ee012d2","resolution":{"observed_at":"2026-08-06T13:24:29.575827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:34.522551Z","title":"Pvt v2: Improved baselines with pyramid vision transformer","venue":null,"work_id":"d0f08dc3-ee13-492a-817c-f86f6d14cb57","year":2022},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:29.651671Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:c44abfc6fd06e4b02168a7a026c15f6f916969321146f96ca42c2c6463464e3c","observation_id":"57326a31-7fed-419a-9e03-f04f782c88ca","resolution":{"observed_at":"2026-08-06T13:24:34.591109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:29.738949Z","title":"Drivedreamer: Towards real-world- drive world models for autonomous driving","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:29.738949Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:292d56573f9c208393d6c4ac791d2d5867a2bb836f6549cd78b2182e08c5cf73","observation_id":"2d8e8a11-5f77-4b10-8d4c-a21c080864b3","resolution":{"observed_at":"2026-08-06T13:24:29.738949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07929","last_updated":"2024-02-02T08:02:35Z","snapshot_observed_at":"2026-07-06T16:18:37.399390Z","submitted_at":"2023-09-13T05:43:35Z","title":"Prompting Segmentation with Sound Is Generalizable Audio-Visual Source Localizer","version":3},"cited_work":{"arxiv_id":"2309.07929","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.07929","snapshot_observed_at":"2026-08-06T13:24:31.297834Z","title":"Prompting Segmentation with Sound Is Generalizable Audio-Visual Source Localizer","venue":"cs.CV","work_id":"4edfe677-ba82-47dd-ba87-f3a17568e05c","year":2023},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:29.839727Z"},"links":{"cited_paper":"/paper/2309.07929","citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:98166c218cf3db3cfa1f90d4579ad4a739c44db9e1494a75543ed2be805fe52e","observation_id":"b00d8a91-7e04-44c4-be8e-414d4a62e7f1","resolution":{"observed_at":"2026-08-06T13:24:31.372411Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:34.310519Z","title":"Prompting segmentation with sound is gen- eralizable audio-visual source localizer","venue":null,"work_id":"d328d581-26e9-4c51-bbbb-f7de94bb314b","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:29.911767Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:95416279444c6048f44e370b522ebaca557ebc13f9c58ba21bd79b0620f1e028","observation_id":"d84413af-577e-40c0-bc13-1a6e731270b3","resolution":{"observed_at":"2026-08-06T13:24:34.366851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:34.138277Z","title":"Can textual semantics mitigate sounding object segmentation preference? In European Conference on Com- puter Vision, pages 340–356","venue":null,"work_id":"f0c86d9a-095f-441f-9717-074eefff9a54","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:30.002229Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:f040bbc02a4bfc8e54ec81dcea16e624b88836e8970ecda9610cc6616fa1c398","observation_id":"2e1162cf-9d17-4e68-b0cc-8e8d71258c23","resolution":{"observed_at":"2026-08-06T13:24:34.206530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:33.987290Z","title":"Large-scale con- trastive language-audio pretraining with feature fusion and keyword-to-caption augmentation","venue":null,"work_id":"55a45035-e8da-4133-9598-7375fbf3d41b","year":2023},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:30.078314Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:f9cb204af3de0a12a0c943bdeb23a629116d06c1e7c6647e4b5c68f612c26d44","observation_id":"145afdec-8d79-44d4-a233-1db959720e1c","resolution":{"observed_at":"2026-08-06T13:24:34.033283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.14084","last_updated":"2021-10-01T15:13:27Z","snapshot_observed_at":"2026-08-04T06:58:39.755482Z","submitted_at":"2021-09-28T23:01:51Z","title":"VideoCLIP: Contrastive Pre-training for Zero-shot Video-Text Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.14084","snapshot_observed_at":"2026-08-06T13:24:30.193705Z","title":"Videoclip: Contrastive pre-training for zero-shot video-text understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:30.193705Z"},"links":{"cited_paper":"/paper/2109.14084","citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:1ccf4d4c51320280ec58fe7b1a7950e2083ee65febd70fce31a539df0628e0d8","observation_id":"2f93e96f-c19c-41b4-8489-c070a09d9865","resolution":{"observed_at":"2026-08-06T13:24:30.193705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:33.828351Z","title":"Referred by multi-modality: A unified tem- poral transformer for video object segmentation","venue":null,"work_id":"838cdae0-a6f1-40e5-b950-3b6d10eff825","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:30.264676Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:6d98e077fff0bf050e3cda701aa2c07186d992ec8682e6091693be7afc6459c4","observation_id":"25e4326e-a60c-4e3f-b7ee-99d4bb643f4a","resolution":{"observed_at":"2026-08-06T13:24:33.919685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:33.696242Z","title":"Cooperation does matter: Exploring multi-order bilateral relations for audio- visual segmentation","venue":null,"work_id":"3279e9a4-dfc0-416f-91e8-30978ae5f494","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:30.395792Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:9518262cc8754b9998347ad6885c3195fc3f7dca76f84eb3966fd5c366967c1a","observation_id":"5434c471-de08-4491-804c-0091f009c7c1","resolution":{"observed_at":"2026-08-06T13:24:33.757091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:33.550467Z","title":"Revisiting counterfactual prob- lems in referring expression comprehension","venue":null,"work_id":"1924f7bb-73f9-4220-8e75-9d356361ac57","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:30.482824Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:55aa1b8b809d59aa358c5be925a8e578e15b393b458d3434d4ca59543105d325","observation_id":"c1f36da8-5497-4e1f-9186-b2268aa953a2","resolution":{"observed_at":"2026-08-06T13:24:33.617230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:33.379006Z","title":"Losh: Long-short text joint prediction network for referring video object segmentation","venue":null,"work_id":"8b540de2-919a-4437-9bda-298cc0581ddc","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:30.591093Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:8a257f942198778279a3ad4db02882f10b558ade601ca3d73aedf0c5cdd3aca8","observation_id":"fc20ea18-d27a-4797-a966-e1b8bd72dcee","resolution":{"observed_at":"2026-08-06T13:24:33.459830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:33.224228Z","title":"Discovering the real association: Multimodal causal rea- soning in video question answering","venue":null,"work_id":"67f409ce-b2f4-4334-adcd-2d936bcb1f51","year":2023},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:30.648645Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:39e681870a3c3a356520a48f3153c8e5a8749b1ffa0651fcd90bb7a0ad1c4446","observation_id":"9c325e08-f56f-4645-b594-f7a34b8e575a","resolution":{"observed_at":"2026-08-06T13:24:33.321674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:33.100721Z","title":"Weakly- supervised mirror detection via scribble annotations","venue":null,"work_id":"53567de1-77c5-4404-a4fd-1df7befff3c6","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:30.711366Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:cc101479bb35ea8d976930321633e38dc27650b67d0972421a2231a3f0827ede","observation_id":"de25b491-8657-4d1f-8b76-893d79779aad","resolution":{"observed_at":"2026-08-06T13:24:33.147692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:32.939210Z","title":"Heterogeneous experts and hierarchical perception for un- derwater salient object detection","venue":null,"work_id":"96e3f5a2-a2c8-4178-b36e-4a0bf6e82f7a","year":2025},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:30.787086Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:cc663e06859a681760cb103fea06ad64e583d195957f1186a43d7db93ae1248e","observation_id":"7410b16a-d8ab-4b01-b633-cbee76be50da","resolution":{"observed_at":"2026-08-06T13:24:32.969158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:32.818909Z","title":"Causal intervention for weakly- supervised semantic segmentation","venue":null,"work_id":"0de9321d-e143-4a67-bee6-555362d2bb6b","year":2020},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:30.860023Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:6e81f5cae78dee387936bc74f4ce9f59e016f74dce46d3d1d381e486cbce28db","observation_id":"5310ff46-d21b-4fc5-836b-00592f7203dc","resolution":{"observed_at":"2026-08-06T13:24:32.874213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:30.918766Z","title":"Audio–visual segmentation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:30.918766Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:12651ac90450750ed715857c92a61407b5fc5b6239e09a72488c7dc505c009d4","observation_id":"919094cc-387d-44d6-9e58-d36771852dd4","resolution":{"observed_at":"2026-08-06T13:24:30.918766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:32.516276Z","title":"Audio-visual segmentation with semantics","venue":null,"work_id":"be7ddabd-5da9-47bc-bf43-874df17c413c","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:31.109915Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:3ae89059ca503c4a9289e4699a32155d5bddb5258984f5caece67f05d53465e0","observation_id":"ed7a1761-fd70-4dab-bcb5-a3e28308dedc","resolution":{"observed_at":"2026-08-06T13:24:32.591154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:32.366379Z","title":"Exploring pre-trained text- to-video diffusion models for referring video object segmen- tation","venue":null,"work_id":"74059f7c-b478-487b-abe8-7970fa0d3e1b","year":2024},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:31.180804Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:4e30056f17844db497d8312d39dc1909cbc79caecf7ee9fdf2708dfb4f1b66db","observation_id":"cc711852-876c-4aff-83cc-ffd8923a2ae3","resolution":{"observed_at":"2026-08-06T13:24:32.424693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:24:32.647345Z","title":"2, 5, 6, 8","venue":null,"work_id":"cca018d8-7d87-4d09-8e60-c58ea0884051","year":2022},"citing_paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation","version":1},"reference_index":403,"source":"pdf_text","source_observed_at":"2026-08-06T13:24:31.029697Z"},"links":{"citing_paper":"/paper/2507.20740"},"observation_digest":"sha256:b09589d9cc6723ec6bdab8460a7d2f309c9641ffccba4f384e570d0bfbc90001","observation_id":"9abe49c0-d912-40e2-9f47-04af5b5e656a","resolution":{"observed_at":"2026-08-06T13:24:32.709159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.20740","last_updated":"2025-07-28T11:46:35Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T21:15:45.770589Z","submitted_at":"2025-07-28T11:46:35Z","title":"Implicit Counterfactual Learning for Audio-Visual Segmentation"},"reference_resolution":{"displayed":86,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":6,"verified_fuzzy":58},"total_outbound_references":86},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 86 of 86 outbound references and 0 inbound Pith citation observations for arXiv:2507.20740."}