{"as_of":"2026-08-23T15:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3852ccdfc18285d6a43a1dcbf56f15aaf244297ad25e965006b07cab80a71404","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":5,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":5,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T18:46:09.031350Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T23:58:33.347468Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2310.18709","last_updated":"2025-03-02T15:37:39Z","snapshot_observed_at":"2026-08-17T18:11:01.191449Z","submitted_at":"2023-10-28T13:37:52Z","title":"Audio-Visual Instance Segmentation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.18709","snapshot_observed_at":"2026-08-12T18:46:09.031350Z","title":"Audio-visual instance segmentation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.11278","last_updated":"2025-03-11T05:22:20Z","snapshot_observed_at":"2026-08-18T17:36:03.220911Z","submitted_at":"2024-11-18T04:35:20Z","title":"Towards Open-Vocabulary Audio-Visual Event Localization","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T18:46:09.031350Z"},"links":{"cited_paper":"/paper/2310.18709","citing_paper":"/paper/2411.11278"},"observation_digest":"sha256:7d9571bfcf5eb416aec5e583c6e2326a616fe87f362d79bd67cb1aa5f2ebbd72","observation_id":"957f44bc-9f62-468c-b23e-716e6fea6864","resolution":{"observed_at":"2026-08-12T18:46:09.031350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18709","last_updated":"2025-03-02T15:37:39Z","snapshot_observed_at":"2026-08-17T18:11:01.191449Z","submitted_at":"2023-10-28T13:37:52Z","title":"Audio-Visual Instance Segmentation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.18709","snapshot_observed_at":"2026-08-11T15:42:22.358447Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10749","last_updated":"2024-12-14T08:34:44Z","snapshot_observed_at":"2026-08-19T14:37:49.629651Z","submitted_at":"2024-12-14T08:34:44Z","title":"Patch-level Sounding Object Tracking for Audio-Visual Question Answering","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T15:42:22.358447Z"},"links":{"cited_paper":"/paper/2310.18709","citing_paper":"/paper/2412.10749"},"observation_digest":"sha256:69ec4162b72bf44245b76e30ff6ba85dd55a1d5895d4d9b77343c89bcd96f1bb","observation_id":"59238446-a1ac-4727-bcaf-c8cc281f4ddb","resolution":{"observed_at":"2026-08-11T15:42:22.358447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18709","last_updated":"2025-03-02T15:37:39Z","snapshot_observed_at":"2026-08-17T18:11:01.191449Z","submitted_at":"2023-10-28T13:37:52Z","title":"Audio-Visual Instance Segmentation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.18709","snapshot_observed_at":"2026-08-11T15:13:01.530544Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11248","last_updated":"2024-12-17T07:31:27Z","snapshot_observed_at":"2026-08-18T17:36:34.014699Z","submitted_at":"2024-12-15T16:54:53Z","title":"Multimodal Class-aware Semantic Enhancement Network for Audio-Visual Video Parsing","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T15:13:01.530544Z"},"links":{"cited_paper":"/paper/2310.18709","citing_paper":"/paper/2412.11248"},"observation_digest":"sha256:12b27468062a8325b00eea534a2b6f68b5f440bf60fa5c2c2629a028d43181b4","observation_id":"9f8b9332-6d8a-4bf3-964b-7e7c04d4fff3","resolution":{"observed_at":"2026-08-11T15:13:01.530544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18709","last_updated":"2025-03-02T15:37:39Z","snapshot_observed_at":"2026-08-17T18:11:01.191449Z","submitted_at":"2023-10-28T13:37:52Z","title":"Audio-Visual Instance Segmentation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.18709","snapshot_observed_at":"2026-08-11T13:56:18.245913Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12628","last_updated":"2024-12-18T09:58:32Z","snapshot_observed_at":"2026-08-19T02:46:40.256468Z","submitted_at":"2024-12-17T07:43:36Z","title":"Dense Audio-Visual Event Localization under Cross-Modal Consistency and Multi-Temporal Granularity Collaboration","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T13:56:18.245913Z"},"links":{"cited_paper":"/paper/2310.18709","citing_paper":"/paper/2412.12628"},"observation_digest":"sha256:35b502f3b244bcd3213089487e9f5a2fdff4f3909724611ddbf465a6a4e7942a","observation_id":"39eb78ec-c7a5-4aec-a0ff-6870b39469d1","resolution":{"observed_at":"2026-08-11T13:56:18.245913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18709","last_updated":"2025-03-02T15:37:39Z","snapshot_observed_at":"2026-08-17T18:11:01.191449Z","submitted_at":"2023-10-28T13:37:52Z","title":"Audio-Visual Instance Segmentation","version":4},"cited_work":{"arxiv_id":"2310.18709","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.18709","snapshot_observed_at":"2026-08-05T23:58:33.347468Z","title":"Audio-Visual Instance Segmentation","venue":"cs.CV","work_id":"5ad282a7-b6fb-4599-9304-ae7a316bf48d","year":2023},"citing_paper":{"arxiv_id":"2508.04566","last_updated":"2025-08-06T15:49:53Z","snapshot_observed_at":"2026-08-17T03:39:28.605998Z","submitted_at":"2025-08-06T15:49:53Z","title":"CLASP: Cross-modal Salient Anchor-based Semantic Propagation for Weakly-supervised Dense Audio-Visual Event Localization","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-05T23:58:33.017171Z"},"links":{"cited_paper":"/paper/2310.18709","citing_paper":"/paper/2508.04566"},"observation_digest":"sha256:8e6b192b2913c90262cba2c3ed1d9560f9195318fa5456858697a68a90a65f0f","observation_id":"a6bfcabf-60c5-4559-ab44-c7548af4850b","resolution":{"observed_at":"2026-08-05T23:58:33.454579Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2310.18709/citation-record","integrity":"/paper/2310.18709/integrity","json":"/paper/2310.18709/citation-record.json","paper":"/paper/2310.18709"},"outbound":[],"paper":{"arxiv_id":"2310.18709","last_updated":"2025-03-02T15:37:39Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T18:11:01.191449Z","submitted_at":"2023-10-28T13:37:52Z","title":"Audio-Visual Instance Segmentation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 5 inbound Pith citation observations for arXiv:2310.18709."}