{"as_of":"2026-08-10T18:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:751aceb4d0607b968b97f13009605a3707667ddb482127367857f1f8887afea4","coverage":[{"denominator":86,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":86,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T11:16:10.475961Z","state":"measured"},{"denominator":87,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":87,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T15:35:37.095627Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T10:11:08.927215Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"cited_work":{"arxiv_id":"2507.22886","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.22886","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards omnimodal expressions and reasoning in referring audio-visual segmentation","venue":null,"work_id":"3546df82-ca74-443b-91bf-2cdacb57142d","year":2025},"citing_paper":{"arxiv_id":"2604.11789","last_updated":"2026-04-20T14:38:53Z","snapshot_observed_at":"2026-08-09T05:10:13.009841Z","submitted_at":"2026-04-13T17:55:02Z","title":"LMMs Meet Object-Centric Vision: Understanding, Segmentation, Editing and Generation","version":2},"reference_index":210,"source":"pdf_text","source_observed_at":"2026-05-10T15:35:37.095627Z"},"links":{"cited_paper":"/paper/2507.22886","citing_paper":"/paper/2604.11789"},"observation_digest":"sha256:b4cc4f3f0f6f4ccef61d2f655abc09a2881aa0c1fba350fdd5bb0665659baa8a","observation_id":"f4afe86d-fbd3-4785-a992-0802dc92b695","resolution":{"observed_at":"2026-05-11T10:11:08.958133Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.22886/citation-record","integrity":"/paper/2507.22886/integrity","json":"/paper/2507.22886/citation-record.json","paper":"/paper/2507.22886"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:06.019397Z","title":"Qwen Technical Report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:06.019397Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:a71b1d6a2b3f686897b3e55cddf8ee06fb6aaf7caa05941ae76ad2525af10ffb","observation_id":"1ce8bf37-9ae5-49f7-b3e4-78a3253ac6ea","resolution":{"observed_at":"2026-08-06T11:16:06.019397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T11:16:06.094700Z","title":"Qwen-VL: A Frontier Large Vision-Language Model with Versatile Abilities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:06.094700Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:3b936114258e2878c7e6a6b6b6740cb9b9caa1d3403dffec771be30a1b7e8533","observation_id":"2f00d2a4-c04b-4525-9a71-c51d555eb531","resolution":{"observed_at":"2026-08-06T11:16:06.094700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:06.158565Z","title":"One Token to Seg Them All: Language Instructed Reasoning Segmentation in Videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:06.158565Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:8e8d1bfded2ea8ea122350e96fe2e7cc070f6b311b7f46fd894046989a44bc04","observation_id":"a5525f58-491f-4f40-93f7-0b2218537b1b","resolution":{"observed_at":"2026-08-06T11:16:06.158565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:06.221846Z","title":"METEOR: An Au- tomatic Metric for MT Evaluation with Improved Correla- tion with Human Judgments","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:06.221846Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:b6cf68890d42fc0133d00edbc3ead0179a9c94bf8f87d26a6a6c4aa14868ff38","observation_id":"022d88cb-68fc-4714-ac2f-f3c71fb547e8","resolution":{"observed_at":"2026-08-06T11:16:06.221846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:06.274355Z","title":"End-to-End Referring Video Object Segmentation with Mul- timodal Transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:06.274355Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:f9103deb8cb9be12c5d732dda7994dab90e07da3cc8c43d56a1d1ca82089f8dc","observation_id":"777041a2-00ee-4a1a-9dc6-3c07deffeaeb","resolution":{"observed_at":"2026-08-06T11:16:06.274355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:06.346121Z","title":"Auditory Scene Analysis: The Perceptual Organization of Sound","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:06.346121Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:dc0d9a9416c4f54fe4ceafa004172b1824acf4c773ab028e100c2f9d5257083d","observation_id":"e8e3eb20-6961-4062-a322-8376d74a004c","resolution":{"observed_at":"2026-08-06T11:16:06.346121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:06.422372Z","title":"COCO- Stuff: Thing and Stuff Classes in Context","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:06.422372Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:7003a40305af5f149df11803d1634b6e7c33d75d05562d6eff8fe9b1f633a942","observation_id":"9784a756-a69b-4dc8-8bc6-cbd6e11ed1b5","resolution":{"observed_at":"2026-08-06T11:16:06.422372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:12.264195Z","title":"TIM: A Time Interval Ma- chine for Audio-Visual Action Recognition","venue":null,"work_id":"e5860a46-7b3f-4648-adff-e4546a859971","year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:06.485367Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:d56fe325c19188139fe76de0ba1113addc3ae716555e21dc6a5eb8c3a59c41ad","observation_id":"e53caa16-5819-4119-b0bd-d8051b52809f","resolution":{"observed_at":"2026-08-06T11:16:12.269880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:12.244250Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","venue":null,"work_id":"9585622b-4b6c-4152-b939-2142c9d8af3b","year":2021},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:06.596129Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:24be4c7e8ca4aa2ba49a3baa21fb701175843e1998a4cfda6fafb100f189f276","observation_id":"c505fc3d-73be-4808-9367-b907a3ce0dc7","resolution":{"observed_at":"2026-08-06T11:16:12.252941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:12.227550Z","title":"VGGSound: A Large-scale Audio-Visual Dataset","venue":null,"work_id":"61223182-198f-4e12-a0e6-c269a50f30fb","year":2020},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:06.636040Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:cbc6b02396fc96a8ab627182f6db08d5ab8760f2dbd57554b3bd57b52e452291","observation_id":"1ae1bae4-45c0-424a-8d2f-ee1031106421","resolution":{"observed_at":"2026-08-06T11:16:12.232394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:12.204532Z","title":"Detect What You Can: Detecting and Representing Objects using Holistic Models and Body Parts","venue":null,"work_id":"68a6bfa6-923b-4ef5-87cc-648eede9d3b8","year":null},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:06.696935Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:696585b3160ea2a78ca6c953b188f614253878b8f5e62226b610494ec7baddf6","observation_id":"042946cb-fc4c-4e03-a6e0-73db51bb935a","resolution":{"observed_at":"2026-08-06T11:16:12.210671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:12.185435Z","title":"Vision Transformer Adapter for Dense Predictions","venue":null,"work_id":"327a3c0a-a1f6-4f96-8b93-ed714faf23b3","year":2023},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:06.774702Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:a030d063c2ffe5097056ad086db4cfcc33b94220c0f7d8319d8e8e6722622e9c","observation_id":"646c8340-d9cb-4d95-8eeb-802e3e114d5e","resolution":{"observed_at":"2026-08-06T11:16:12.190592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-06T11:16:06.856376Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open- Source Suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:06.856376Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:744945c1835212af5f6e30656a6356b864d8411a22422bbe3abbb97adf24d914","observation_id":"76f515e9-2c19-402f-a1c4-383e0f99abb1","resolution":{"observed_at":"2026-08-06T11:16:06.856376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:12.163651Z","title":"Masked-attention Mask Transformer for Universal Image Segmentation","venue":null,"work_id":"dac5a460-98e8-4081-bf28-1e0b5c60607e","year":2022},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:06.974243Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:0c4bad43dd7d68360cacf15259127543ff7fd996430a0799ddf2a46809c1a959","observation_id":"1e824bbf-bee8-4cc9-9ad0-a5e34c2278c8","resolution":{"observed_at":"2026-08-06T11:16:12.171004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-06T11:16:07.045271Z","title":"VideoLLaMA 2: Advancing Spatial- Temporal Modeling and Audio Understanding in Video- LLMs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:07.045271Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:09caab5b006e7220763e024c5290b65bc4418ab686cafe6b4cfdd4a880fc418b","observation_id":"e2e4208a-25f8-4a3c-bd42-3fac05f3a85d","resolution":{"observed_at":"2026-08-06T11:16:07.045271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-06T11:16:07.101084Z","title":"Qwen2-Audio Technical Report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:07.101084Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:1d95d64de773b92cf7ee900e46116fe71d7d6002de0e9834d4886d551edbeaa5","observation_id":"b10fd106-834c-4e6d-8b7b-ad7c8fdc633b","resolution":{"observed_at":"2026-08-06T11:16:07.101084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:12.144175Z","title":"MeViS: A Large-scale Benchmark for Video Segmentation with Motion Expressions","venue":null,"work_id":"a3a908d7-d9c7-41ec-9e42-2ed7ecf775bb","year":2023},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:07.286988Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:5ef35af273967bdf5fccdc4e67299246907885b2d2e6c16424d434e5c7deff1c","observation_id":"f6258804-80df-43ff-9a14-46e88b13db52","resolution":{"observed_at":"2026-08-06T11:16:12.149630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:12.122874Z","title":"MOSE: A New Dataset for Video Object Segmentation in Complex Scenes","venue":null,"work_id":"865bc83c-0b11-4a20-a009-f35bdda825ff","year":2023},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:07.373963Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:7fb34401ca7edea0529bc854344d6786a759216912fa90ee8ae84ebca4504cd9","observation_id":"01f7c39d-536f-4319-b801-04d6ef0370b8","resolution":{"observed_at":"2026-08-06T11:16:12.128980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:12.104295Z","title":"Multimodal referring segmentation: A survey","venue":null,"work_id":"c1c0a513-cdbf-4d68-aabd-b6035e8c577a","year":2025},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:07.468288Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:9fd0b15c487b89f0086e2f7d412673d60046a242f82de0a1672f367714b09aae","observation_id":"4f1abf28-9b01-48f0-80fc-2db69cc2c347","resolution":{"observed_at":"2026-08-06T11:16:12.110276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:12.082613Z","title":"MOSEv2: A more challenging dataset for video object segmentation in complex scenes","venue":null,"work_id":"e63ae1ed-d1fb-44f5-977c-c7905c0cbe7f","year":2025},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:07.555289Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:47ebb53373f191b93c968963b091200f4dda03f45d28e35bbd139c946f6a19bd","observation_id":"6c58ef9c-39ad-43f1-91f7-91a7b233dcde","resolution":{"observed_at":"2026-08-06T11:16:12.089024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:12.064668Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","venue":null,"work_id":"4c699fa7-69dd-493b-a529-759b4039da3f","year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:07.614968Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:887fdba7e58e84203aa9e60122dd311cae5f9a2fa946780123c7b81d72ff0d13","observation_id":"a47ca59b-9d8f-4b35-bf3b-54d1f65feaf9","resolution":{"observed_at":"2026-08-06T11:16:12.070253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:12.046728Z","title":"A VSegFormer: Audio-Visual Segmentation with Transformer","venue":null,"work_id":"5338f4ec-126e-45be-a570-c88b42ae0826","year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:07.702971Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:255c4ece816a50c94a8ead3165396e2e3314e4151a06ae053f7e9fa0b3093955","observation_id":"48a5fa52-7c80-4b18-8b04-ac3a66fa6e90","resolution":{"observed_at":"2026-08-06T11:16:12.052365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:12.028417Z","title":"https://github.com/RVC- Boss/ GPT-SoVITS, 2024","venue":null,"work_id":"45566f8e-3b2f-4d85-96e2-22b876a851c5","year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:07.890555Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:2fb1d69399da084386c08940a4f82554d3d16abd356bd2baef66b86b00c400d3","observation_id":"4dd43122-d005-4916-bbd3-36838b48a4d8","resolution":{"observed_at":"2026-08-06T11:16:12.032935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:12.011472Z","title":"Open- V ocabulary Audio-Visual Semantic Segmentation","venue":null,"work_id":"abacee87-9f67-4038-bdb9-390fd5463d71","year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:07.963845Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:b4c32191ee0fc5a5cb0fab27e780316f9634d4f77a3cbcbedb7233817eb4e63c","observation_id":"405c891e-2575-4736-bdea-30422574e22c","resolution":{"observed_at":"2026-08-06T11:16:12.016780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.990687Z","title":"Multi- modal Instruction Tuned LLMs with Fine-grained Visual Perception","venue":null,"work_id":"c75b9059-45ba-4440-8606-ed000079e546","year":null},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:08.053343Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:365196950d8478c247af0256e4f5e8d95954b9f4c93d52b4ebd2006818c1315c","observation_id":"2807b96b-cd94-4504-a8de-d82e0c18893f","resolution":{"observed_at":"2026-08-06T11:16:11.996594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.972601Z","title":"Decoupling Static and Hierarchical Motion Perception for Referring Video Seg- mentation","venue":null,"work_id":"cc557f5c-cb91-4553-8be9-d105741de624","year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:08.146958Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:57a52426614be689d5bfccb91f69ce76f200261c706a70e70a13e29ffc3a93df","observation_id":"1371932c-7134-4480-abe1-c9c9ad800365","resolution":{"observed_at":"2026-08-06T11:16:11.977821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.953818Z","title":"A Generalized Framework for Video Instance Segmentation","venue":null,"work_id":"9f0f3b2c-35ca-4dbb-bd90-d15536413ceb","year":2023},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:08.229361Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:d599caa0b86e12531d220e4a57d30051619e0080b71b96427f65cccf095c3c0b","observation_id":"f6c70001-9a2d-426c-ad4f-06a8182e72a6","resolution":{"observed_at":"2026-08-06T11:16:11.959155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.933775Z","title":"Deep clustering: Discriminative embeddings for segmentation and separation","venue":null,"work_id":"4afee058-4064-40ae-a37d-37b7153615e1","year":2016},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:08.279887Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:0ba56a0f510d59e2b155ff0b616b9564d1f63b59edc7eef300b4d0db19c75128","observation_id":"cd2dc9d9-8f31-40c9-a458-3c397f3283c0","resolution":{"observed_at":"2026-08-06T11:16:11.942633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.916960Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","venue":null,"work_id":"dc71d0d1-88f6-4544-92df-0052aef561f0","year":2022},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:08.397805Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:85bcc2e86ce53c08ae142a3ebf5526ea36d8cecb8d318acc21d13dd7f05a814b","observation_id":"db461c65-20e1-4067-a559-4ffe04388662","resolution":{"observed_at":"2026-08-06T11:16:11.922008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.900979Z","title":"Egocentric Audio-Visual Object Localization","venue":null,"work_id":"8787ebbe-fa8f-4729-928a-a1f3f367f1c9","year":2023},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:08.609708Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:f11b09274731b3f451ca389586958cfd7bc89f93dc7db8ef89e5a60bd5525497","observation_id":"d1af3745-296f-45f2-8d5f-9cc30daa77ac","resolution":{"observed_at":"2026-08-06T11:16:11.905791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.882347Z","title":"Video Object Segmentation with Language Referring Expressions","venue":null,"work_id":"024039bb-b0c7-4e1b-a56a-433a2e4440dd","year":2019},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:08.667631Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:4eb71b83e1bd5a67778c99041bfcdf4d3f93e374f1453a58700986526d9527b7","observation_id":"50a7f8a0-b7c0-4f1b-9ca8-a92f7895044c","resolution":{"observed_at":"2026-08-06T11:16:11.888913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.864446Z","title":"Segment Anything","venue":null,"work_id":"d9d7302f-4869-421e-acde-b828aff74bc0","year":2023},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:08.752455Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:6575b2be8d25c223ca442007943ea626e9d61a6e69e88f19b3796f15f539ae8f","observation_id":"672b7acd-ee7b-4197-8a0b-e39f025dd6dd","resolution":{"observed_at":"2026-08-06T11:16:11.869618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.849117Z","title":"LISA: Reasoning Segmen- tation via Large Language Model","venue":null,"work_id":"bd9a60e2-4d9a-4f29-8bb9-de16c3c0c430","year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:08.844260Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:0a37200fe15892fa9dda3db9e1f7c00e85fdf0a77209bb37eb0d2e4d84d90b49","observation_id":"e8dc9a84-77ca-4455-8bb8-8e76388a25f0","resolution":{"observed_at":"2026-08-06T11:16:11.853787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.832508Z","title":"TVQA: Localized, Compositional Video Question Answer- ing","venue":null,"work_id":"ab2253d8-3db0-48c8-b236-f167614b13a7","year":2018},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:08.989571Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:fa9859288e067f90db6eb27157ba5b36ed86dd9d0da9b83b0882224023ad6805","observation_id":"64d9a684-9cda-4be5-9d2a-d1b0722f00db","resolution":{"observed_at":"2026-08-06T11:16:11.837725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.814295Z","title":"Learning to Answer Questions in Dynamic Audio-Visual Scenarios","venue":null,"work_id":"bd84b7f4-923a-4e64-b7f4-1c3cc70eca27","year":2022},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:09.133635Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:75075e83ed632a5023fe91db1f0c39e5e91ee47eaadf0b82a65bd47ec540dfe2","observation_id":"f176f74b-fda8-43ac-901b-0ec06487a5e0","resolution":{"observed_at":"2026-08-06T11:16:11.819872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.794817Z","title":"Boosting Audio Visual Question Answering via Key Semantic-Aware Cues","venue":null,"work_id":"cf4a61d8-05fb-4484-99aa-34f543cdfffe","year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:09.261515Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:b7c87da54c3b86d60b8a03ba574fa53a1b296776625dbf6178c455334a952ead","observation_id":"f8a8afd9-e3f0-4389-9471-37c213797fff","resolution":{"observed_at":"2026-08-06T11:16:11.800716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.777376Z","title":"Do Audio-Visual Segmentation Models Truly Segment Sounding Objects? arXiv, 2025","venue":null,"work_id":"eee27644-e65d-4060-a297-c651cbe09cc8","year":2025},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:09.423301Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:1ad8d853f25d96278b85cd5a81318574d1320a4cccbeb5d12cc2252347d11d07","observation_id":"fcccefce-30db-4420-a1eb-d1a5452bf3e4","resolution":{"observed_at":"2026-08-06T11:16:11.782524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.758236Z","title":"Robust Referring Video Object Segmentation with Cyclic Structural Consensus","venue":null,"work_id":"483b99cf-60cb-4b32-a613-bbb0eb99727a","year":null},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:09.565012Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:cc38a981d5ee25b5105f14af40d1ad0b0f3c0e556aaa1ecda849835805702a20","observation_id":"645602e0-6408-4407-97dc-4093b00fe8fb","resolution":{"observed_at":"2026-08-06T11:16:11.764123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:09.667789Z","title":"Baichuan-Omni Technical Report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:09.667789Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:6df77a51d76ebcf890b6e3812eab393227edc32dc4f8b33dd126664155dc357b","observation_id":"c8b02ec2-3a3d-4696-8be3-73d21c9be3ea","resolution":{"observed_at":"2026-08-06T11:16:09.667789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.737816Z","title":"Losh: Long-short text joint prediction network for referring video object segmentation","venue":null,"work_id":"270b88b5-ba58-4bac-85c2-6f17f0222408","year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:09.765828Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:098ad41f721b8ffab140311be6a94f1c26d3ee5735af4e89ddee6d2b825f9699","observation_id":"d5aae2dc-9bb8-440b-9bc7-5ff61ddce81d","resolution":{"observed_at":"2026-08-06T11:16:11.743164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.720071Z","title":"GRES: Generalized Referring Expression Segmentation","venue":null,"work_id":"7b9c8722-6508-4cc3-ab26-da4db10a3ad4","year":2023},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:09.891803Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:e35fa654452017ef0a39e74bf5c4db8ee956801023315a5eefa4bf52f610fcc6","observation_id":"50923f62-0614-498b-9011-7e18564c6710","resolution":{"observed_at":"2026-08-06T11:16:11.725625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.700028Z","title":"Primitivenet: decomposing the global constraints for referring segmenta- tion","venue":null,"work_id":"a1dd13c9-13fe-40de-952e-db89f328304b","year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:09.973694Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:736a184175374b70ecc4bf4f520d932e13c83f884c2313e9ab16989bfe2b5c37","observation_id":"891931f1-a7d3-4608-bc87-9c6f7b102264","resolution":{"observed_at":"2026-08-06T11:16:11.705305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.683587Z","title":"Visual Instruction Tuning","venue":null,"work_id":"f92692be-07c4-405d-ae45-d2ecc8793a99","year":2023},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.155107Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:2ca320969c49cff376f4ffb884ac9882f771ca9ea57125a5e341f4c3be6dd2b9","observation_id":"bdfc6c6f-d5ba-4b18-93c0-8dfbcddcee92","resolution":{"observed_at":"2026-08-06T11:16:11.688159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.667385Z","title":"Improved Baselines with Visual Instruction Tuning","venue":null,"work_id":"6399a87b-7b3b-4e7d-860b-badb46ca228d","year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.204533Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:028d1b88bef4060d9d7c9915b22c5de1ee3215cd398418f7498f0b1d4efd0280","observation_id":"1590031a-698e-41ca-b72f-fa229f64fbbc","resolution":{"observed_at":"2026-08-06T11:16:11.672272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.649271Z","title":"ConvBench: A Multi-Turn Conversation Evaluation Benchmark with Hierarchical Ablation Capability for Large Vision-Language Models","venue":null,"work_id":"4cc2f249-a140-44a4-b554-d84aa26621d7","year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.210803Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:4877323f6970889c7994836ade5fd80da6913bb3a84f3111ea91ffd3409c748a","observation_id":"10ab099c-43fb-47a7-a078-5903e288deae","resolution":{"observed_at":"2026-08-06T11:16:11.654463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.629838Z","title":"Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Sep- aration","venue":null,"work_id":"51dd85dc-d2ac-4816-a7be-97453724d515","year":2019},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.217190Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:98e126edb22debfdca4676c75223de3faf5d46d07d27f75c9ea9c5bc2dcf6d15","observation_id":"8abb241e-01d6-4491-9e08-383ddf8654f1","resolution":{"observed_at":"2026-08-06T11:16:11.635223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.603638Z","title":"Stepping Stones: A Progressive Training Strategy for Audio- Visual Semantic Segmentation","venue":null,"work_id":"36a47bf0-c811-4abc-94ae-58c77e2b954e","year":null},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.222759Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:807c53670fd03a7ce0ff68ae00fd7c643bcb55a4a72f36dc77bb25cf9d33b673","observation_id":"015e1808-5f00-4085-98c3-22a9a3013810","resolution":{"observed_at":"2026-08-06T11:16:11.610896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.583186Z","title":"Generation and Comprehension of Unambiguous Object Descriptions","venue":null,"work_id":"0ec69d2d-83bb-4065-ac70-b95d180ed060","year":2016},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.228825Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:0306a28bfa07e69498ba40a019dbfc35b34e7f990200206cf0f7d3dc8a9dedfd","observation_id":"9a25fee9-c7ce-46fd-a42f-0e562430d94a","resolution":{"observed_at":"2026-08-06T11:16:11.588517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.564522Z","title":"V-Net: Fully Convolutional Neural Networks for V olumetric Medical Image Segmentation","venue":null,"work_id":"bb8ed346-e857-4a5c-896c-d89591e6f03c","year":null},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.234547Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:ed506ade857cf8165ba609bb15a3c3a6c6994cf9f7732a8683b28e3d10be572d","observation_id":"0501c317-ebcf-452a-b993-8c1f8f8b4d2c","resolution":{"observed_at":"2026-08-06T11:16:11.570411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.545857Z","title":"https://platform.openai.com/docs/ guides/text-to-speech, 2023","venue":null,"work_id":"207a668a-7b31-451b-b8c7-f7135b82018b","year":2023},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.247239Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:09b52883e83e1c0b5e7955340d6c3f67285d3116f00bbea86a45734a14984bf2","observation_id":"6cbd765e-9f01-4245-a1ce-0c1c298c72f3","resolution":{"observed_at":"2026-08-06T11:16:11.552583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.529073Z","title":"https://openai.com/index/hello- gpt-4o, 2024","venue":null,"work_id":"0616f6a6-499b-4f02-b852-67a5bb800c92","year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.252563Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:147e2fb73bb85162c40b54820fa8c0c4bbf9b62cf6a9365c71686d05efff7ddf","observation_id":"82d8109d-93ff-4236-b5d7-e40bc2dcf588","resolution":{"observed_at":"2026-08-06T11:16:11.534588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.510965Z","title":"Wnet: Audio-Guided Video Object Segmentation via Wavelet-Based Cross-Modal Denoising Networks","venue":null,"work_id":"9ed4d22d-f760-4f18-8aa9-41fe37ec9ce8","year":2022},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.260334Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:b754d8956004ab042bc229fc17218720c247076761b477fce23e0cb13dc37b87","observation_id":"6a185d90-b484-4179-baa4-a6d681f6e7b2","resolution":{"observed_at":"2026-08-06T11:16:11.516684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.492750Z","title":"DetGPT: Detect What You Need via Reasoning","venue":null,"work_id":"7adad704-5d87-412c-bb80-baa97af639cf","year":2023},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.269021Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:4b7dbbaaa5da339a8710d0aca6e89d719e326e41574e4e1b25cece3cc508736c","observation_id":"1b467605-e0aa-40c9-bc9c-023ef0f3f312","resolution":{"observed_at":"2026-08-06T11:16:11.498976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.475532Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","venue":null,"work_id":"eac8be49-6255-4883-a5b0-c87bc054bdc9","year":2023},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.278238Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:f2062c701e522c3fc2505bc9d91297e93964cf0805c47842bf78da07f86767e7","observation_id":"cbcbf9cf-d2f6-449e-bbdc-68cfc1239e0c","resolution":{"observed_at":"2026-08-06T11:16:11.480708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.428499Z","title":"PACO: Parts and Attributes of Common Objects","venue":null,"work_id":"df65ac26-c907-4f97-a4f4-74a18fc7d76f","year":2023},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.285742Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:d965a8707055f52cc844346d1b5c0ac4e13b842026db9e64144e61ebdaaacc07","observation_id":"c563c37b-4b53-45a7-be18-589aece25f6f","resolution":{"observed_at":"2026-08-06T11:16:11.444625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-06T11:16:10.292503Z","title":"SAM 2: Segment Anything in Images and Videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.292503Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:e6d4e6f1b4723df510661311c9bbe28faac1f9fa9b43dada78c0196f483df501","observation_id":"6e4bfd0c-8c92-4dff-ba5d-033188d7a457","resolution":{"observed_at":"2026-08-06T11:16:10.292503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.384151Z","title":"URVOS: Unified Referring Video Object Segmentation Network with a Large-Scale Benchmark","venue":null,"work_id":"e17b6758-167c-45ae-bb14-fd9cde3b3ee5","year":2020},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.298834Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:2d884f52cfa78fb22d7d10c9cf3ed2085224917fda3035a7331e45a92156b8f7","observation_id":"00c96345-f537-42d2-996d-8d48ef230711","resolution":{"observed_at":"2026-08-06T11:16:11.405620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.360012Z","title":"video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models","venue":null,"work_id":"3d17541d-eb82-4d0e-a65b-2cb85d2723cf","year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.304319Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:96b727095458eaeb03af0067173cee528c1aa027d51ab354af302be6733d57ca","observation_id":"ec9d5370-ca5d-47a2-a75d-17e77bc45517","resolution":{"observed_at":"2026-08-06T11:16:11.364909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.341313Z","title":"Auto- ACD: A Large-scale Dataset for Audio-Language Represen- tation Learning","venue":null,"work_id":"cc078adc-2d20-4567-a649-dedc4700fa11","year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.312650Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:4d99227b613e5e587cc547d8a17b8d84612f50ad520978aa20df7447c22a32d3","observation_id":"43f66742-91dd-46ec-8af0-56562b948142","resolution":{"observed_at":"2026-08-06T11:16:11.347843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.323242Z","title":"Unveiling and Mitigating Bias in Audio Visual Segmentation","venue":null,"work_id":"49234a64-8554-4f2d-98a3-7e16a2a0d5dd","year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.319486Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:e82504afb217c62cafc7c6b504dce7bc017d851921d5a22d8c80259639e5e0e4","observation_id":"e9f020c3-53c3-4b7e-9352-6abb95a70ee2","resolution":{"observed_at":"2026-08-06T11:16:11.330373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.306646Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models","venue":null,"work_id":"abbb3b14-6329-4ee4-8946-c0997a178cb5","year":2023},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.324756Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:c6a7fa41bd42b8e04f784edd6e76de2395be13951cfdb7f900bdf2f03d04ec77","observation_id":"10441679-27b3-40d4-ae73-4bb067d5a7d8","resolution":{"observed_at":"2026-08-06T11:16:11.311783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.284720Z","title":"Audio-Visual Event Localization in Unconstrained Videos","venue":null,"work_id":"cc3b9277-040f-4c82-8058-31281b0a9a0c","year":2018},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.330368Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:bd1d187faac057cbb24279ff0849912bdfb14802e37bc460855bb7b4303f637c","observation_id":"d62a2be0-8151-4f94-8b91-b354b07c882c","resolution":{"observed_at":"2026-08-06T11:16:11.290558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T11:16:10.336496Z","title":"Qwen2-VL: Enhancing Vision-Language Model’s Perception of the World at Any Resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.336496Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:5cc456e1d68dfc7664aaa0da5a2abf6162ab829d710265097e32100265eb1270","observation_id":"2d7d6602-7a14-4756-bee0-279c1d915fb5","resolution":{"observed_at":"2026-08-06T11:16:10.336496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.265737Z","title":"Audio-Visual Grounding Referring Ex- pression for Robotic Manipulation","venue":null,"work_id":"f6552051-0f92-43d2-93e3-34447b076383","year":2022},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.341868Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:900d6b85fbd798f121f6c262f256913f7b88724986ec9ddee5b3aab62e8c979a","observation_id":"9dc3b0b3-a9e6-4331-bf5a-a7eaa1d6b5cb","resolution":{"observed_at":"2026-08-06T11:16:11.271327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.246498Z","title":"Prompting Segmentation with Sound Is Generalizable Audio-Visual Source Localizer","venue":null,"work_id":"1be8f3fa-4716-4198-9b20-360fd027b3e4","year":null},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.357613Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:ffd1c9fe4738b742521ae9de858b8c700f135dfb9553f0eee5247552f3c5b937","observation_id":"244a95f7-f82a-40e5-9e11-73152644fc18","resolution":{"observed_at":"2026-08-06T11:16:11.253156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.229609Z","title":"Can Textual Semantics Mitigate Sounding Object Segmentation Preference? In Eur","venue":null,"work_id":"2284c9e1-5ddc-4b35-a385-448e4c51053a","year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.363089Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:48e2a020543ec0c404d7647a54af28b9f23c31e60a628568284e385e2e0d5a42","observation_id":"977b99c5-f402-4b6c-a997-dce4e653e001","resolution":{"observed_at":"2026-08-06T11:16:11.234846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.212665Z","title":"Ref-A VS: Refer and Segment Objects in Audio-Visual Scenes","venue":null,"work_id":"a99ddd33-7dfb-4792-87c2-b5f9bb277f6f","year":null},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.369265Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:582580534c36a692311ac3d24453869c350ab200711a857f2188c1c8fb635723","observation_id":"631e99e6-604d-4d89-ad36-31efa91f39f7","resolution":{"observed_at":"2026-08-06T11:16:11.218188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.192123Z","title":"Language as Queries for Referring Video Object Segmentation","venue":null,"work_id":"f555fee2-d58f-4cc5-bb76-723a144b8488","year":null},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.374194Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:c5cb271e5b763e713fb28226b1e52842dbeab8a7cf625b580dbf5c4601edc8f8","observation_id":"04473527-a83e-40a6-811e-0b61852742e8","resolution":{"observed_at":"2026-08-06T11:16:11.198186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.165129Z","title":"VISA: Reasoning Video Object Segmentation via Large Language Models","venue":null,"work_id":"509a3bf1-c626-4773-a1be-0e8dad1089cb","year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.378825Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:f19e60f47be7b7e76d3d71794172fea36e3567f3c9414c833b218f12624c3bcc","observation_id":"777ad773-26d4-453f-8f81-38b7847d8705","resolution":{"observed_at":"2026-08-06T11:16:11.174877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.140387Z","title":"Referred by Multi-Modality: A Unified Temporal Transformer for Video Object Segmentation","venue":null,"work_id":"90770f14-30f0-463a-953a-d4ace953e9d5","year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.387330Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:365612b42eb31856856ee309233796dfa0aba1fd2f169f365d49bb6761faa1ce","observation_id":"8116845e-6924-4180-b5be-c901cef114e4","resolution":{"observed_at":"2026-08-06T11:16:11.146807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.112585Z","title":"A VQA: A Dataset for Audio-Visual Question Answering on Videos","venue":null,"work_id":"626fc5bd-1774-49a6-b91b-16a012dee3d9","year":2022},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.394479Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:834f5a5bd7530f52be19027e86552535ffda56f595692199594c0288ea9c2822","observation_id":"46080188-6cf1-486a-8db9-15479764098e","resolution":{"observed_at":"2026-08-06T11:16:11.121804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.089229Z","title":"LA VT: Language-Aware Vision Transformer for Referring Image Segmentation","venue":null,"work_id":"63448ef3-b633-49a6-bd45-e5e51447de9b","year":2022},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.399323Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:793b69e862366770742705119cc30619dbcf1d21eebb577a2b28e39dd3a085b0","observation_id":"d1978e52-dd29-4c52-b280-80f4a309769b","resolution":{"observed_at":"2026-08-06T11:16:11.095686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.060007Z","title":"Isda: Position-aware instance segmentation with deformable attention","venue":null,"work_id":"070b027c-203e-4859-8bb3-1a851aa96429","year":null},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.409682Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:5595bd01a22e15eff7cbe67549a9b9465e8f69a6bace360e1868b94de4a25e24","observation_id":"95031c31-a3e3-417d-93f3-0937d2a67d77","resolution":{"observed_at":"2026-08-06T11:16:11.064986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.038924Z","title":"CTVIS: Consistent Training for Online Video Instance Segmentation","venue":null,"work_id":"57664890-4b8d-4426-86e5-30d739220e24","year":2023},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.414531Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:c71db7cf13198ef54e4c86f5d1e878a8a385941cf75c00dd9057a9ad810db67a","observation_id":"585b8fae-a251-4094-b1d6-05e743ac25d6","resolution":{"observed_at":"2026-08-06T11:16:11.044795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.011988Z","title":"MMT-Bench: A Comprehensive Multimodal Benchmark for Evaluating Large Vision-Language Models Towards Multitask AGI","venue":null,"work_id":"821befa2-f732-418a-9e23-706ebce26947","year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.420373Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:460786a63b5f65a97322b6363b1f86dc2b7ceb684ed41603d34923ebd94a9f10","observation_id":"4478e543-28aa-49f9-8f7f-66ef2796a7c2","resolution":{"observed_at":"2026-08-06T11:16:11.017438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:10.985525Z","title":"MOVE: Motion-guided few-shot video object segmentation","venue":null,"work_id":"1fe29a91-0ed0-4ce2-bfbf-f646a9e6b290","year":2025},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.425968Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:250194851e9075414c34848a18e08a6578a4ce30ecda73607681440411bd9e2f","observation_id":"4abbf53c-1812-4652-8e2e-20332cfcfee0","resolution":{"observed_at":"2026-08-06T11:16:10.995052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:10.958770Z","title":"Modeling Context in Referring Expressions","venue":null,"work_id":"92c7170f-3c04-4426-ba29-9d2be309db8a","year":2016},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.430262Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:e5900c5a6f105af24642eb00833dfbcf0907e43a4d80af5d032ec745d1364ed2","observation_id":"e239833f-6bb0-4853-bbd8-114595adcdeb","resolution":{"observed_at":"2026-08-06T11:16:10.964609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:10.935072Z","title":"MOTR: End-to-End Multiple-Object Tracking with Transformer","venue":null,"work_id":"b6a8e903-f804-46f9-9dd0-dd0518d50cc4","year":2022},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.435156Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:4914c5d3d6b8104842f6bdd533c798f8f48f1b35acdd4e105f4f29c6c326bd87","observation_id":"3f0d94cf-bbe8-4685-8d81-ca5875f7e677","resolution":{"observed_at":"2026-08-06T11:16:10.945246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:10.914662Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","venue":null,"work_id":"b1d3cda9-9b3a-4ce9-bd79-e63f2ee6131e","year":2023},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.439995Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:3a6ce8bd388c0178700d06ae6aa86d62328b46b07da02c0691a8b92f07f4cdb4","observation_id":"ae1f22c0-d178-4c3b-ad7c-2f9fcd04f24e","resolution":{"observed_at":"2026-08-06T11:16:10.921392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:10.896877Z","title":"LLaMA-Adapter: Efficient Fine-tuning of Large Language Models with Zero- initialized Attention","venue":null,"work_id":"1dbdf236-28be-4d99-8ccf-0498905dfaad","year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.444754Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:d7988d7d17168b8309441d545f3e436a60e8fef945681aca655404a55446cf56","observation_id":"60db074e-da48-4dee-ac7e-11891f91c7ef","resolution":{"observed_at":"2026-08-06T11:16:10.902176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03601","last_updated":"2025-06-12T00:15:18Z","snapshot_observed_at":"2026-08-07T18:00:59.339869Z","submitted_at":"2023-07-07T13:43:44Z","title":"GPT4RoI: Instruction Tuning Large Language Model on Region-of-Interest","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03601","snapshot_observed_at":"2026-08-06T11:16:10.449340Z","title":"GPT4RoI: Instruction Tuning Large Language Model on Region-of-Interest","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.449340Z"},"links":{"cited_paper":"/paper/2307.03601","citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:fc45ab3e3f5b524b5b2a09c107d2749be345b59dcd6d024004fca7c7a5d287ec","observation_id":"a24455e6-9922-4a95-9d94-7a0c5ac81fa1","resolution":{"observed_at":"2026-08-06T11:16:10.449340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:10.880288Z","title":"DVIS: Decoupled Video Instance Segmentation Framework","venue":null,"work_id":"0387cd5a-a892-4133-89b2-99c8457bd109","year":2023},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.454902Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:fe1dd9a3ad8c0f325b24858329c19ab6ae768189f4be4e22d6304bb440f5bc42","observation_id":"3dd6e515-9ec8-43cd-987f-fa1c1d08a13f","resolution":{"observed_at":"2026-08-06T11:16:10.885373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14500","last_updated":"2025-03-16T14:39:54Z","snapshot_observed_at":"2026-08-03T02:01:04.625797Z","submitted_at":"2024-07-18T17:59:17Z","title":"ViLLa: Video Reasoning Segmentation with Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14500","snapshot_observed_at":"2026-08-06T11:16:10.460552Z","title":"ViLLa: Video Reasoning Segmentation with Large Language Model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.460552Z"},"links":{"cited_paper":"/paper/2407.14500","citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:31cfb040ba876d4e91e05a12c1f83cc4ebfc33931b6f374af0d5bcc888d5d00a","observation_id":"f35ef5b4-7b2b-4406-9312-0d74b021a834","resolution":{"observed_at":"2026-08-06T11:16:10.460552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:10.863800Z","title":"Scene Parsing through ADE20K Dataset","venue":null,"work_id":"6b2b581d-da8e-49f0-9e15-9035161bb942","year":2017},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.465447Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:742df030d543d7f66f20a183c539a1ce3e4d109ff3fb1b23e2f2dfda0946881f","observation_id":"77a47579-e561-4dec-99a8-67aeadf588f5","resolution":{"observed_at":"2026-08-06T11:16:10.868533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:10.848020Z","title":"Audio-Visual Segmentation","venue":null,"work_id":"7811d815-8eea-41c8-90f9-9b4b607710d1","year":2022},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.470620Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:e723eb10e9b2c35afcd95a3a9541f407af5834e07e69f44006a336c6aa356663","observation_id":"b4440455-5ce6-4e3d-bcb1-fdbf7fc961df","resolution":{"observed_at":"2026-08-06T11:16:10.852538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:10.824615Z","title":"Tracking with Human-Intent Reasoning","venue":null,"work_id":"8cd8ccd9-4ae0-454b-9ae3-6d6bd7786169","year":2023},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.475961Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:a76eeda316d5a57ba1c5a467bff4ce428f126d1a72d70f4af16ae41dc9ee0d27","observation_id":"68aa03c1-fccc-480d-9709-0703fb587fc1","resolution":{"observed_at":"2026-08-06T11:16:10.832815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation"},"reference_resolution":{"displayed":86,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":0,"verified_fuzzy":71},"total_outbound_references":86},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 86 of 86 outbound references and 1 inbound Pith citation observation for arXiv:2507.22886."}