{"as_of":"2026-08-15T21:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cfc2720f7fef9e0bd327811467525a9bb4c5d2d635da53d9230f9c340d0fed4f","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:44:12.200891Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.01558/citation-record","integrity":"/paper/2506.01558/integrity","json":"/paper/2506.01558/citation-record.json","paper":"/paper/2506.01558"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:11.322434Z","title":"Self-calibrated clip for training-free open-vocabulary segmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-09T06:07:41.748272Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.322434Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:4fc35f4bff02282a445f9e10af6ff1c765110dde2f584bb52dde38a02d57078a","observation_id":"5f657d51-1ebb-49b7-a1c1-a31055a06513","resolution":{"observed_at":"2026-08-07T11:44:11.322434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:11.348892Z","title":"Unraveling in- stance associations: A closer look for audio-visual segmenta- tion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-09T06:07:41.748272Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.348892Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:eedae5d44f9be0ab4336b7d0ecdc976bf1389a9a6b9a8e65d14df486068d3c4b","observation_id":"4106bdea-8ebf-42b7-b522-168cf3635064","resolution":{"observed_at":"2026-08-07T11:44:11.348892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T14:19:26.598265Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T11:44:11.369535Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-09T06:07:41.748272Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.369535Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:d237b16e1fb2084b95bf156638822f02a6a2993c51e007124bf1f9fac60d43bc","observation_id":"28ddbb4c-1743-43ca-a927-991312d9307f","resolution":{"observed_at":"2026-08-07T11:44:11.369535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:14.719529Z","title":"Avsegformer: Audio-visual segmentation with trans- former","venue":null,"work_id":"5f7605ec-abbb-4036-a806-30641612d0e8","year":2024},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-09T06:07:41.748272Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.393623Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:9d03d14715d7b25a6378de7afdd6b07ea753703cab5fd6973b824d5c906d08a6","observation_id":"9dbd80ee-966b-44cf-9bd8-158540a1080f","resolution":{"observed_at":"2026-08-07T11:44:14.736426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:14.687353Z","title":"Audio set: An ontology and human- labeled dataset for audio events","venue":null,"work_id":"e8f1175d-096e-4b20-a245-9aa88fd7c1da","year":2017},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-09T06:07:41.748272Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.422743Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:069556514d41858b3c234fe6d98a215391e242ab06f57d0d3cb49bedf2fbf3bf","observation_id":"20ec1905-41b2-4500-bd1c-255311445b5a","resolution":{"observed_at":"2026-08-07T11:44:14.699455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:14.650178Z","title":"Cnn archi- tectures for large-scale audio classification","venue":null,"work_id":"e666cdef-198d-42da-bcb2-4a8ba82c3aaf","year":2017},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-09T06:07:41.748272Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.443369Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:915e39c8e1b1d05586e143f4a77099578eb84f9362526a8955033298536c6419","observation_id":"36ef3bfc-767c-4f91-9234-e25c73b26324","resolution":{"observed_at":"2026-08-07T11:44:14.667367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:14.614519Z","title":"Referitgame: Referring to objects in pho- tographs of natural scenes","venue":null,"work_id":"726aa265-1337-4559-a293-438ccee25346","year":2014},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-09T06:07:41.748272Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.467929Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:6c9a98192e935b33be96ecea2d1fede0f2da664b3e9427af059c6c1f343a8c6e","observation_id":"0bd5aab6-3c94-4e93-9d15-3be7573625d0","resolution":{"observed_at":"2026-08-07T11:44:14.631580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:11.487126Z","title":"Segment any- thing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-09T06:07:41.748272Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.487126Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:0e682d11528fc62b752547de927c1c864e520f1d387317ae41e33fb0ce77c4ef","observation_id":"112943e8-e328-4570-85bf-0f711cd5c1a1","resolution":{"observed_at":"2026-08-07T11:44:11.487126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:11.507306Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-09T06:07:41.748272Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.507306Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:22055fc0c159e234ba4386ced636f0cb9787a5bb36a84d2a13a792e26794768a","observation_id":"44aa1544-d441-432f-a99f-8a2339efc465","resolution":{"observed_at":"2026-08-07T11:44:11.507306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:14.567216Z","title":"Learning to answer questions in dynamic audio-visual scenarios","venue":null,"work_id":"9ee85464-314d-4cf0-90a3-db9a9a496caf","year":2022},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-09T06:07:41.748272Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.527309Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:240dd24b7a0d6b683b33afa59beed4463f83ee28b180b96d07e2392e1aba3a97","observation_id":"a8e998dc-9bfe-4169-a895-9b7f0e2d6e10","resolution":{"observed_at":"2026-08-07T11:44:14.580940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:11.551397Z","title":"Robust referring video object segmentation with cyclic structural consensus","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-09T06:07:41.748272Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.551397Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:6127de74d0ced5f32f8da292db517823bf90b3f1cdbbec480f7607a94217cb0d","observation_id":"dd7a614f-769c-40c2-a826-1465021b808b","resolution":{"observed_at":"2026-08-07T11:44:11.551397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:14.516931Z","title":"Libero: Benchmarking knowl- edge transfer for lifelong robot learning","venue":null,"work_id":"001990fa-a3b2-4d1e-bae9-d9a4a44f0227","year":2024},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-09T06:07:41.748272Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.568454Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:e169f15aa697d6d57958aa2e1f538edac658bd89a7dfb03ff46f13471ab8fd6f","observation_id":"68ac84f6-97a6-4d9e-9619-a4d26330f4de","resolution":{"observed_at":"2026-08-07T11:44:14.532561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:14.480902Z","title":"GRES: Gen- eralized referring expression segmentation","venue":null,"work_id":"b46a3bfe-6a96-42e0-a981-0d2f1ab42ed5","year":2023},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-09T06:07:41.748272Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.584902Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:1a8ec96147be2f1533ddb58854d7dfa3b1de3827a2e77e471a7d85a504f7f7f9","observation_id":"b7696e5c-1259-4a90-a136-bc97a26f253b","resolution":{"observed_at":"2026-08-07T11:44:14.498870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:11.601043Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-09T06:07:41.748272Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.601043Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:5f5c379df9390d7fcf485f04659568d54ae414036f916696b5ad2e4ed84c9677","observation_id":"abedcc9d-ea78-471c-b193-3feea0248855","resolution":{"observed_at":"2026-08-07T11:44:11.601043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:11.621005Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-09T06:07:41.748272Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.621005Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:0b90096efd2c771c69ddfa6e2df7635bd8315bd40b158c02467c7eba658aeae8","observation_id":"e108d5a6-4276-4322-8943-95722e94cc8f","resolution":{"observed_at":"2026-08-07T11:44:11.621005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-07T11:44:11.639745Z","title":"Roberta: A robustly optimized bert pretraining approach","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-09T06:07:41.748272Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.639745Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:d8c0b52fb9550ac3f5dd9bce060eb015adfe002d233cfc22d3f7ecd8b87066bb","observation_id":"a2c1f8d2-72ed-4b08-804b-9a28108aa5a3","resolution":{"observed_at":"2026-08-07T11:44:11.639745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:14.431186Z","title":"Open-vocabulary segmentation with semantic-assisted calibration","venue":null,"work_id":"3c4d7375-1020-47c7-8b59-72567141c978","year":2024},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-09T06:07:41.748272Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.660057Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:1bb6217e203c055b5a21c429a7600e18caf812504c6b0de29a0a212208dd08fd","observation_id":"e1580b59-e6a2-4b27-adb5-7382a9c7bf06","resolution":{"observed_at":"2026-08-07T11:44:14.446323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:14.382187Z","title":"Universal segmentation at arbi- trary granularity with language instruction","venue":null,"work_id":"b3a51b18-8e04-40ac-bec5-f8265a90f92e","year":2024},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-09T06:07:41.748272Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.677555Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:4ab474f289bf2ff21f6de990a62abc21566d1f204bd063a9f4ee5bbfc6a270c1","observation_id":"d3be685d-3edd-4cb2-a54e-cce2bfe266c4","resolution":{"observed_at":"2026-08-07T11:44:14.399232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:11.704295Z","title":"Decoupled weight de- cay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-09T06:07:41.748272Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.704295Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:34a4e4ef211c0428a799575b9b953e57a62ec40c53fbaa6dee80bbe6afbde797","observation_id":"f94e348d-ca8a-47fc-ace8-4688e635702d","resolution":{"observed_at":"2026-08-07T11:44:11.704295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:14.341092Z","title":"Soc: Semantic-assisted object cluster for referring video object segmentation","venue":null,"work_id":"b7d426e9-9c11-4709-b4c4-2e29490ec12f","year":2024},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-09T06:07:41.748272Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.721300Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:6055e0442e4b595194c519761094db132838b4cdbb0786517dcca2c2eaba5a5a","observation_id":"09e0cbf6-df4a-49e9-94f7-25215f04a837","resolution":{"observed_at":"2026-08-07T11:44:14.354324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:14.291828Z","title":"Mod- eling context between objects for referring expression un- derstanding","venue":null,"work_id":"69eefe5f-ad3c-49c7-8bd4-a946f40adb4b","year":2016},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-09T06:07:41.748272Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.738165Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:070ee02ecd7845dd65278546fb79a81addbd4721211beb5a93f1909c059223cb","observation_id":"16f510cc-11dc-4c5a-a067-d6c1aef562ba","resolution":{"observed_at":"2026-08-07T11:44:14.313045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-07T11:44:11.756990Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-09T06:07:41.748272Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.756990Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:1ac5097651624f8625a6ec4e83aeb3171978a5be6a1094e06e3611c95208eb38","observation_id":"b645e32b-6c58-4403-94c1-1563de57e8aa","resolution":{"observed_at":"2026-08-07T11:44:11.756990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:14.248512Z","title":"Pixellm: Pixel reasoning with large multimodal model","venue":null,"work_id":"f22f7021-23ec-4810-bb1a-16d144edcac9","year":2024},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-09T06:07:41.748272Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.778749Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:c3d7b5f592881d34c00c954ad398f5bdff2d0bca016323e37d68d72e985dccd6","observation_id":"247f7548-6d8e-430a-9382-b699f0dee7a6","resolution":{"observed_at":"2026-08-07T11:44:14.269637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01108","last_updated":"2020-03-01T02:57:50Z","snapshot_observed_at":"2026-08-07T19:07:36.327251Z","submitted_at":"2019-10-02T17:56:28Z","title":"DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01108","snapshot_observed_at":"2026-08-07T11:44:11.802462Z","title":"Distilbert, a distilled version of bert: smaller, faster, cheaper and lighter.arXiv preprint arXiv:1910.01108,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-09T06:07:41.748272Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.802462Z"},"links":{"cited_paper":"/paper/1910.01108","citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:48fce0e5e679b447e67d30a2106915f471852fc6916efc56a882a5b8b28a5e2f","observation_id":"e51c9301-f233-417f-95a4-7afa4d1929a7","resolution":{"observed_at":"2026-08-07T11:44:11.802462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:14.208330Z","title":"Efficient attention: Attention with lin- ear complexities","venue":null,"work_id":"7fde7d5f-ed4e-4bd3-a7ab-c20cef9d9698","year":2021},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-09T06:07:41.748272Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.832827Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:e0fac4aa7165bb584605a7167c7921338e9a382672d32c8880321561f27db7d0","observation_id":"3028eb4f-1c46-4812-92eb-c73560c00a93","resolution":{"observed_at":"2026-08-07T11:44:14.225927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:11.848405Z","title":"Roformer: Enhanced transformer with rotary position embedding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-09T06:07:41.748272Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.848405Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:f480b15db9134300fa3f74201f9ed5a6a0f261f445e89bafad0b166c8469ddc0","observation_id":"5878c5f0-72c0-41ed-a211-55eac3e2713c","resolution":{"observed_at":"2026-08-07T11:44:11.848405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:14.171864Z","title":"Auto- acd: A large-scale dataset for audio-language representation learning","venue":null,"work_id":"f77054c9-8ccd-43a2-82d3-6609d142fe9b","year":2024},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-09T06:07:41.748272Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.871678Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:ecf748fc1b20c1e1f49aedfbde12c05098a585d9885c774c7b9174f787e6163d","observation_id":"bc52a43d-4679-4847-ad56-7721d435448c","resolution":{"observed_at":"2026-08-07T11:44:14.182438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07929","last_updated":"2024-02-02T08:02:35Z","snapshot_observed_at":"2026-08-13T10:14:41.482712Z","submitted_at":"2023-09-13T05:43:35Z","title":"Prompting Segmentation with Sound Is Generalizable Audio-Visual Source Localizer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07929","snapshot_observed_at":"2026-08-07T11:44:11.892307Z","title":"Prompting segmentation with sound is generalizable audio-visual source localizer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-09T06:07:41.748272Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.892307Z"},"links":{"cited_paper":"/paper/2309.07929","citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:c19802ef4c4378c721b1e624b81632ba138780cdfb573d7173657ede5c29b926","observation_id":"f31b91df-7213-47e0-aca7-bd32ddac1e79","resolution":{"observed_at":"2026-08-07T11:44:11.892307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:14.138893Z","title":"Efficient remote sensing transformer for coastline detection with sentinel-2 satellite imagery","venue":null,"work_id":"97d8ce58-212d-46f9-bda1-04ad45994b82","year":2023},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-09T06:07:41.748272Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.907122Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:b63b260d02b67929347631f5adeaaafc2534a6ee74d05566037eaece7d9ebf39","observation_id":"64f558e1-147b-468f-878c-483ff6fa7bbe","resolution":{"observed_at":"2026-08-07T11:44:14.151753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:14.093239Z","title":"Prompting segmentation with sound is gen- eralizable audio-visual source localizer","venue":null,"work_id":"d8b2578f-17d8-4a3b-8c1b-f5bfed0cf972","year":2024},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-09T06:07:41.748272Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.924209Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:91d1d3ce3c8d884526a7573ee9baafb1e340217b1be1877cd5aa77b983143512","observation_id":"58ab5cbc-bd89-45e4-b97f-f47dc87a431e","resolution":{"observed_at":"2026-08-07T11:44:14.117916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:14.045465Z","title":"Ref-avs: Refer and segment objects in audio-visual scenes","venue":null,"work_id":"d3fd0626-b403-46ab-93bd-b75aca948d22","year":2024},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-09T06:07:41.748272Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.945322Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:e81fd7ed35f9a2f501cc40b4993d54cd62f72743f21aeca8545a8b6ecdbea524","observation_id":"2e111730-5219-4b15-8ebf-ad71dd6e9371","resolution":{"observed_at":"2026-08-07T11:44:14.060729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:14.008860Z","title":"Convolution meets trans- former: Efficient hybrid transformer for semantic segmenta- tion with very high resolution imagery","venue":null,"work_id":"bd041314-9348-40e1-baf7-a5f4135602f2","year":2024},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-09T06:07:41.748272Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.959188Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:8b936f5c1727f05638d1c200592ad9e72b56c9a7b8f8b15b02171e7d72fe7414","observation_id":"493dc4ad-5486-4df8-804b-0238b2ed74bc","resolution":{"observed_at":"2026-08-07T11:44:14.026308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00936","last_updated":"2025-03-02T15:19:37Z","snapshot_observed_at":"2026-08-07T17:35:45.126755Z","submitted_at":"2025-03-02T15:19:37Z","title":"IteRPrimE: Zero-shot Referring Image Segmentation with Iterative Grad-CAM Refinement and Primary Word Emphasis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.00936","snapshot_observed_at":"2026-08-07T11:44:11.980254Z","title":"Iterprime: Zero-shot referring image segmen- tation with iterative grad-cam refinement and primary word emphasis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-09T06:07:41.748272Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.980254Z"},"links":{"cited_paper":"/paper/2503.00936","citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:b791da66ed2803b6a1b1b9ccc2cc6018015e597fdef6b4ecd517f60594ca5ac9","observation_id":"5cb92975-e83f-4199-a288-d262b10ca69c","resolution":{"observed_at":"2026-08-07T11:44:11.980254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:11.997831Z","title":"Onlinerefer: A simple online baseline for referring video object segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-09T06:07:41.748272Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:11.997831Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:5d60d6b50e9c400c590cb7692c20bcd71119375b2a80b2fbfb6b6202d6457911","observation_id":"4138baf4-d4f3-423a-bb44-b3b7c22d4c7c","resolution":{"observed_at":"2026-08-07T11:44:11.997831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:12.014816Z","title":"Language as queries for referring video object seg- mentation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-09T06:07:41.748272Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:12.014816Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:36d155068b10ee5687f85b889859dc5464ce595227eea081f57e956702fec6a3","observation_id":"b4aace26-db3c-4949-8b24-73b9f780121b","resolution":{"observed_at":"2026-08-07T11:44:12.014816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:13.955019Z","title":"Language as queries for referring video object seg- mentation","venue":null,"work_id":"08a09ddb-71c5-452e-97b1-5b0259164612","year":2022},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-09T06:07:41.748272Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:12.032542Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:a6d676685dc9759f141a2dd6647ef93eb57580f6a28a4371c17156938d979c50","observation_id":"0882748c-073e-47fa-aa91-48331e4454a4","resolution":{"observed_at":"2026-08-07T11:44:13.972399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:13.918418Z","title":"Gsva: Generalized segmentation via multimodal large language models","venue":null,"work_id":"236fe52a-96c0-42da-9028-9b6fddbd845f","year":2024},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-09T06:07:41.748272Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:12.045116Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:7f624fd5820da1fdde091966a9e89f9d11fb19c49ef470b6cd66580f48076016","observation_id":"4d8b0770-911d-4830-955e-49fbd5ba5748","resolution":{"observed_at":"2026-08-07T11:44:13.935682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:12.061070Z","title":"Efficientsam: Leveraged masked image pretraining for efficient segment anything","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-09T06:07:41.748272Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:12.061070Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:195c9cb7bc1f21d770c4efa10979a5b0ea0b9d61c78fab9792c36bb9a9a35d33","observation_id":"d7575162-9125-4f72-a778-1645e4c6b5a8","resolution":{"observed_at":"2026-08-07T11:44:12.061070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:12.605831Z","title":"Avqa: A dataset for audio- visual question answering on videos","venue":null,"work_id":"1862c6a6-7736-43fb-b067-872b506cb10f","year":2022},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-09T06:07:41.748272Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:12.078141Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:652f37a4b5038dfc93f03117f772ed0051b94e51a6b2460ef0e481a6d4b5c9cf","observation_id":"338baf62-16e1-439a-bd25-27965cef8bea","resolution":{"observed_at":"2026-08-07T11:44:13.878090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:12.563158Z","title":"Lavt: Language-aware vision transformer for referring image segmentation","venue":null,"work_id":"17805f41-b76b-4374-9e5e-e9bcd4a0eef8","year":2022},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-09T06:07:41.748272Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:12.092128Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:0dfc762f398fa0196e43c6f238023ceb1841cb2feb70011ba9c9277a3677c785","observation_id":"9556304f-7048-4819-9f84-f36361c06f50","resolution":{"observed_at":"2026-08-07T11:44:12.578490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:12.525097Z","title":"Language- aware vision transformer for referring segmentation","venue":null,"work_id":"de3253ba-4d02-48c0-bc18-a6195cb2cd09","year":null},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-09T06:07:41.748272Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:12.110003Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:647ba191cb8b8f42313a4697507d596c55775e357af7563a9f93bd9a3f05ebb5","observation_id":"16a50437-db4c-45f7-9e15-127705cd219f","resolution":{"observed_at":"2026-08-07T11:44:12.541709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14289","last_updated":"2023-07-01T07:26:22Z","snapshot_observed_at":"2026-08-12T07:11:05.316372Z","submitted_at":"2023-06-25T16:37:25Z","title":"Faster Segment Anything: Towards Lightweight SAM for Mobile Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14289","snapshot_observed_at":"2026-08-07T11:44:12.122600Z","title":"Faster segment anything: Towards lightweight sam for mo- bile applications","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-09T06:07:41.748272Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:12.122600Z"},"links":{"cited_paper":"/paper/2306.14289","citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:54bd893767730443fcdc40477f3f09e2973c422c083e1dd6358c75d70953d698","observation_id":"fd632782-eadc-4606-8d53-4ee658adf5c9","resolution":{"observed_at":"2026-08-07T11:44:12.122600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20076","last_updated":"2025-03-10T12:34:24Z","snapshot_observed_at":"2026-08-12T23:32:30.568069Z","submitted_at":"2024-06-28T17:38:18Z","title":"EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.20076","snapshot_observed_at":"2026-08-07T11:44:12.137620Z","title":"Evf-sam: Early vision-language fusion for text-prompted segment anything model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-09T06:07:41.748272Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:12.137620Z"},"links":{"cited_paper":"/paper/2406.20076","citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:91cae8eab09553e363cd15d1744c38e372e35f2ca2c20da4789cb925dc7ec7fe","observation_id":"d7f2f6e5-a0fd-4d05-91d9-d1a3c3424bb8","resolution":{"observed_at":"2026-08-07T11:44:12.137620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12156","last_updated":"2023-06-21T10:08:29Z","snapshot_observed_at":"2026-08-13T11:12:44.426861Z","submitted_at":"2023-06-21T10:08:29Z","title":"Fast Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12156","snapshot_observed_at":"2026-08-07T11:44:12.151305Z","title":"Fast segment any- thing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-09T06:07:41.748272Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:12.151305Z"},"links":{"cited_paper":"/paper/2306.12156","citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:4c0164825fbdaf2f5c0673e892fdb7dca363db1b11936a9775886e54b8c8e413","observation_id":"6d85d712-5c57-410d-8660-822dd4315a3c","resolution":{"observed_at":"2026-08-07T11:44:12.151305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:12.480000Z","title":"Audio-visual segmentation","venue":null,"work_id":"2280cd6f-4ba3-463f-b10f-f19578759d2d","year":2022},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-09T06:07:41.748272Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:12.170613Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:175f211db4234df6ed4c8dffe8a77de16bb95671dc16ea55bcc8985441e3658a","observation_id":"98aa6ac5-3a2e-4830-9d09-ed2199079c42","resolution":{"observed_at":"2026-08-07T11:44:12.500281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13190","last_updated":"2023-01-30T18:53:32Z","snapshot_observed_at":"2026-08-15T10:24:48.510436Z","submitted_at":"2023-01-30T18:53:32Z","title":"Audio-Visual Segmentation with Semantics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.13190","snapshot_observed_at":"2026-08-07T11:44:12.186738Z","title":"Audio- visual segmentation with semantics","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-09T06:07:41.748272Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:12.186738Z"},"links":{"cited_paper":"/paper/2301.13190","citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:c61cfc352376cbd6c564c8b1e7cd435febd32a65e6e95f996831df60418f78c4","observation_id":"3321ace5-26c3-49e0-8a45-7ab64cb4f444","resolution":{"observed_at":"2026-08-07T11:44:12.186738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:44:12.200891Z","title":"Generalized decoding for pixel, image, and lan- guage","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-09T06:07:41.748272Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:12.200891Z"},"links":{"citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:e9d1ea4880e0ecd14d986b9e8d57265649751ea72953afc68903b7554508e9c6","observation_id":"518e8f9d-885c-4021-83d6-3e19bb0a794f","resolution":{"observed_at":"2026-08-07T11:44:12.200891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T06:07:41.748272Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":24},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 0 inbound Pith citation observations for arXiv:2506.01558."}