{"as_of":"2026-08-09T22:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d5fcede473d7aa71a823bfbc258a1791c51848f9b32df66f511e97c9b419d661","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T22:20:47.097341Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.03264/citation-record","integrity":"/paper/2608.03264/integrity","json":"/paper/2608.03264/citation-record.json","paper":"/paper/2608.03264"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:48.146991Z","title":null,"venue":null,"work_id":"43ef3038-8f9c-4806-8ec3-ff725e9ce0e8","year":2020},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-09T21:11:12.501850Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:46.968366Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:52e350186b163414ed6788fe830679bdfddc28c9f725e4915cbc491054f2a10b","observation_id":"eaa25535-711e-4f3a-a769-6c44d2416505","resolution":{"observed_at":"2026-08-05T22:20:48.149983Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07517","last_updated":"2023-10-11T14:15:25Z","snapshot_observed_at":"2026-08-06T00:08:08.825506Z","submitted_at":"2023-10-11T14:15:25Z","title":"CM-PIE: Cross-modal perception for interactive-enhanced audio-visual video parsing","version":1},"cited_work":{"arxiv_id":"2310.07517","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.07517","snapshot_observed_at":"2026-08-05T22:20:47.858073Z","title":"CM-PIE: Cross-modal perception for interactive-enhanced audio-visual video parsing","venue":"cs.CV","work_id":"a8a645df-eb54-454f-a5c4-3b783853821d","year":2023},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-09T21:11:12.501850Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:46.971471Z"},"links":{"cited_paper":"/paper/2310.07517","citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:7c4c9630d57e953c0d5dbdcba108d71f0f59f8ac5e4628df8938f807fcb25051","observation_id":"d729942d-0a84-41ae-945c-c632c2dc21ba","resolution":{"observed_at":"2026-08-05T22:20:47.861590Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:48.137617Z","title":null,"venue":null,"work_id":"fa611a5e-ab28-4a37-9eb4-f1d100c73f3b","year":2024},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-09T21:11:12.501850Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:46.974945Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:b6147af4f2940f5c86bd2ca48eea3e263cf04d67a0eef77f83ebc15407585060","observation_id":"65adbaaf-dcbb-476e-92dd-4b698fcda1fa","resolution":{"observed_at":"2026-08-05T22:20:48.141486Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10764","last_updated":"2021-12-20T18:59:59Z","snapshot_observed_at":"2026-08-09T21:31:49.496159Z","submitted_at":"2021-12-20T18:59:59Z","title":"Mask2Former for Video Instance Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10764","snapshot_observed_at":"2026-08-05T22:20:46.977826Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-09T21:11:12.501850Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:46.977826Z"},"links":{"cited_paper":"/paper/2112.10764","citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:2d25875a01e4b63d994f7a4d76157ac3839855013faae188cdee321cc31032e2","observation_id":"c631030b-3c73-4f78-a06e-796a12b477db","resolution":{"observed_at":"2026-08-05T22:20:46.977826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:48.127683Z","title":null,"venue":null,"work_id":"dcb8c711-7ee5-453c-89e6-275a22d4fc7d","year":2022},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-09T21:11:12.501850Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:46.980836Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:fe999a64923a17fe03e1395488be98c4ba58d4d3064fc4a6a781fa83f76fc6cf","observation_id":"72ab3102-02ff-4120-8652-5d6b8f92abda","resolution":{"observed_at":"2026-08-05T22:20:48.131868Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:48.118414Z","title":null,"venue":null,"work_id":"efee7130-9e8e-47c2-a3d8-c96deb9039b5","year":2025},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-09T21:11:12.501850Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:46.983334Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:f4fd304dfc1fb81f4b38a2a83dfe709ae2c067f9cebde1c7488cb834d8738442","observation_id":"aba6d726-24a6-4f4d-8933-b315c24410a2","resolution":{"observed_at":"2026-08-05T22:20:48.121763Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:46.986308Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-09T21:11:12.501850Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:46.986308Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:7a852bdd6aab21992edb0f3822e96806cbdd89b5803f2e624c0cde987a5d05d1","observation_id":"64307ea4-088b-4558-ac02-8815c1e9a6cc","resolution":{"observed_at":"2026-08-05T22:20:46.986308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:48.103958Z","title":null,"venue":null,"work_id":"c918ac1a-8452-4f94-8067-d27194ca922d","year":2024},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-09T21:11:12.501850Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:46.988817Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:f7a8d231deadd1726df05cbac7ad9e5fa720150dd0262e4ac04632c4d6e8019d","observation_id":"c5ff3d31-32f2-40eb-b890-24aaf73a12b3","resolution":{"observed_at":"2026-08-05T22:20:48.107075Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2025.35356","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.834663Z","title":null,"venue":null,"work_id":"bbde30fd-d6ce-4797-8063-dc0e85d7073b","year":2025},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-09T21:11:12.501850Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:46.991271Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:c3c17bcfbb239571429589c2217235881c7efbadac31a2fae4d9244ed2b1cac9","observation_id":"56aa824d-f455-46d3-8b9a-73bdfd350639","resolution":{"observed_at":"2026-08-05T22:20:47.840162Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:48.094598Z","title":null,"venue":null,"work_id":"3e45343b-f98a-4ee1-813c-69782c3f7798","year":2024},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-09T21:11:12.501850Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:46.993827Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:94d51f9870afdaaf81007034ed33809392c7a8f9ef4ede14bfa9e01fe9801dd7","observation_id":"2ae97255-c011-4419-93fd-a57e036ad93b","resolution":{"observed_at":"2026-08-05T22:20:48.098281Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2025.35429","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.762862Z","title":null,"venue":null,"work_id":"770909df-bea5-45a5-a0fb-c44954fdea0e","year":2025},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-09T21:11:12.501850Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:46.996674Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:e0bfd4429777ab90d232f9e29abeddf3c535ba736ea2b190a69df51cea24ce9d","observation_id":"1421b5ca-f85e-4dd3-97f3-df5bbc9196af","resolution":{"observed_at":"2026-08-05T22:20:47.767858Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-05T22:20:46.999276Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-09T21:11:12.501850Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:46.999276Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:d02eae23f5c4e9959b8a30477911d57e7b049d6e5fd24f285d3955c10a9ceb9e","observation_id":"95849dce-e49f-4957-8f94-fb6003c8830e","resolution":{"observed_at":"2026-08-05T22:20:46.999276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.00396","last_updated":"2022-08-05T17:54:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-10-31T03:32:18Z","title":"Efficiently Modeling Long Sequences with Structured State Spaces","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.00396","snapshot_observed_at":"2026-08-05T22:20:47.001998Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-09T21:11:12.501850Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.001998Z"},"links":{"cited_paper":"/paper/2111.00396","citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:fe68e1c702cc7d76a4d4e34cfaa2dd7dcb3412d513e3e525a035de8bc2d5f2ac","observation_id":"9d29f10c-828d-4c53-b511-f2fda78f1f8a","resolution":{"observed_at":"2026-08-05T22:20:47.001998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:48.084132Z","title":null,"venue":null,"work_id":"a378ae1b-e427-4ce0-9d95-6b1a39dfe97f","year":2025},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-09T21:11:12.501850Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.004489Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:143d5203a33e18e101fc9e080f180d81d2bafbfbac13e3b69e3d4414532e8592","observation_id":"3f4fcf82-af46-4b35-b2cc-c5f6645219df","resolution":{"observed_at":"2026-08-05T22:20:48.087600Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:48.073874Z","title":null,"venue":null,"work_id":"4e9bc162-fdfb-4554-b8b5-0605fb819b18","year":null},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-09T21:11:12.501850Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.007131Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:593aa79c7c063d47bde396a06ba3c96d23711c7f9e9b785ac24bd9431cef9b16","observation_id":"eeaf4d72-20d0-4110-be68-4fa00f860dd3","resolution":{"observed_at":"2026-08-05T22:20:48.077156Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.012092Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-09T21:11:12.501850Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.012092Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:6df39017e58c98cfdef2b3b38389afe7c755dc01744b37a389400f3c690de73c","observation_id":"46a66836-e689-4cb9-b4a4-a491a1c71ede","resolution":{"observed_at":"2026-08-05T22:20:47.012092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:48.046943Z","title":null,"venue":null,"work_id":"1195541e-5455-4e95-83eb-5eecf88e4402","year":null},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-09T21:11:12.501850Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.014759Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:bd8f8cc48dbfbced818b86bc6714ba43bb4d06f90e2c00fa3cb133b69f29c1a7","observation_id":"627bcc17-a4ff-4f01-8282-5fa0e0f80377","resolution":{"observed_at":"2026-08-05T22:20:48.050169Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.020126Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-09T21:11:12.501850Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.020126Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:3f8102301cd2e72f57c5de326d475e041c61743e0d21c4a15555dbb5d97f4b15","observation_id":"ae4d3b10-6fcf-4af4-92a4-7dcb2213e0dc","resolution":{"observed_at":"2026-08-05T22:20:47.020126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.09501","last_updated":"2023-09-18T05:58:06Z","snapshot_observed_at":"2026-08-09T16:34:30.513409Z","submitted_at":"2023-09-18T05:58:06Z","title":"Discovering Sounding Objects by Audio Queries for Audio Visual Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.09501","snapshot_observed_at":"2026-08-05T22:20:47.022621Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-09T21:11:12.501850Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.022621Z"},"links":{"cited_paper":"/paper/2309.09501","citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:ebf0c95d1912cf174f10a49c4a168139781c33acfc35d0321f801e615ebd29ef","observation_id":"129e167f-c79f-44bc-a950-696bf00a21e0","resolution":{"observed_at":"2026-08-05T22:20:47.022621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:48.021842Z","title":null,"venue":null,"work_id":"4ab709d8-cef7-4eb8-8553-aeaf453bb8e3","year":2025},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-09T21:11:12.501850Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.025995Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:90c3b0911acae3e0d91012f7d661adfe70b0d383bd2efe33b5db192fd3598606","observation_id":"bcce444a-146d-45d4-aeda-a341981a6eaf","resolution":{"observed_at":"2026-08-05T22:20:48.025814Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:48.012015Z","title":null,"venue":null,"work_id":"1a4b5284-50d9-4b55-ac05-33dc752c6d1e","year":2021},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-09T21:11:12.501850Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.028406Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:ef34109324c3b5b2487e05b818fafdfbd76483c3cd0a8c275815c4944be0f8f0","observation_id":"77a69dd2-473e-4cef-9885-91c6f4853220","resolution":{"observed_at":"2026-08-05T22:20:48.015286Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.031260Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-09T21:11:12.501850Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.031260Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:7012fd1d76988a06f42d693c655e5a6808e1505c0289a62df21176d56b3d5821","observation_id":"8137e550-c77a-4e63-a144-72cc7ee71d72","resolution":{"observed_at":"2026-08-05T22:20:47.031260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.984908Z","title":null,"venue":null,"work_id":"37f6466b-3cd0-489e-bc3a-fb5380765c41","year":1955},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-09T21:11:12.501850Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.036465Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:e8c51ae8b5bd7f9f2dc9d5a2fa7f5f8a98ebdcaf08b72e592cdf6f201d4f58c9","observation_id":"f9f93386-eef9-465a-b6dd-86544e0d5bb2","resolution":{"observed_at":"2026-08-05T22:20:47.988247Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.038914Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-09T21:11:12.501850Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.038914Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:c2503ea737f9abe38b2f9a44e4dbac614836d9a77f11a559758c9eb6092c44d8","observation_id":"5445e4a4-578c-43b5-adb9-53b05a5938e2","resolution":{"observed_at":"2026-08-05T22:20:47.038914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.16924","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.615909Z","title":null,"venue":null,"work_id":"5112ba74-6136-4e4a-9fd0-6bacb6230f5f","year":2025},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-09T21:11:12.501850Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.041622Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:47384a0bb263ad837df8a3bb01048d22833b7fbd9353e77e94b98bf108902473","observation_id":"a95728fe-d1f0-4347-a03c-ec396870c3e2","resolution":{"observed_at":"2026-08-05T22:20:47.620299Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.043930Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-09T21:11:12.501850Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.043930Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:e31bcb19c4d874c9079fc01524559131d38782f28712c9ee2fe5e6b5f5800b4f","observation_id":"c001451a-f592-427b-8c6c-7f29be14e319","resolution":{"observed_at":"2026-08-05T22:20:47.043930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.969267Z","title":null,"venue":null,"work_id":"1d6aae10-2cd6-4b38-8c18-1af08908c556","year":2025},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-09T21:11:12.501850Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.046439Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:6153cad661ec382cbb7369d0eb25e7110584e6c6c37b89fc4bd9c15daf9dee60","observation_id":"9b5fce69-5f7c-4e02-8d39-cd65a86abbd4","resolution":{"observed_at":"2026-08-05T22:20:47.972806Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.049034Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-09T21:11:12.501850Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.049034Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:fc2de90ccefd3c4087594104781594bd4fd1453c8d1ff7f7284bbaae2bda0414","observation_id":"2be4d592-5d47-468c-99d0-4a264f74b04a","resolution":{"observed_at":"2026-08-05T22:20:47.049034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.051413Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-09T21:11:12.501850Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.051413Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:ec7332b87088142d6af5eed6c456cdce4076cece3273ee0631a9975412bbeb82","observation_id":"6cfe210b-3ade-4f36-aca3-9199a7d0085d","resolution":{"observed_at":"2026-08-05T22:20:47.051413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.950143Z","title":null,"venue":null,"work_id":"a06bfe0d-c215-4f5b-9b4b-0c207d3046df","year":2017},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-09T21:11:12.501850Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.053799Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:c1f81e0cdb70997a36ea72948f4ef384055ff6b82bd6b4a325562ce4f7690ff9","observation_id":"d88881ba-8178-4f84-b69e-0711355f876d","resolution":{"observed_at":"2026-08-05T22:20:47.953219Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.939958Z","title":null,"venue":null,"work_id":"bbb3399c-55be-4a7b-bf4b-eb4059a1547a","year":2021},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-09T21:11:12.501850Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.056388Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:addd11463d2c62e3efce8d0ee747b438e119f7a126be740cc9d4040173691f35","observation_id":"88e860b3-446a-4699-845b-a871afeea73b","resolution":{"observed_at":"2026-08-05T22:20:47.944151Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.07619","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.540628Z","title":null,"venue":null,"work_id":"4b6f6270-86b3-4e63-81f3-b74ba03ae3ff","year":2025},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-09T21:11:12.501850Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.059153Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:1e46d4162de33eb44224532ed8a2e14c3156f3586bfd902a263cc6ff213caf1b","observation_id":"f3b7eda0-ccbc-4311-bf89-a74370bed6b9","resolution":{"observed_at":"2026-08-05T22:20:47.544770Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.14203","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.482046Z","title":null,"venue":null,"work_id":"5a238371-ca21-4974-9188-8d0530b1ad2a","year":2026},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-09T21:11:12.501850Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.061621Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:14fcde22dad727d56a0cb279435a594dcff0d36803c3397dcb363eced691b88f","observation_id":"4b244050-50a9-49e7-a6f6-d71410e9d03c","resolution":{"observed_at":"2026-08-05T22:20:47.486666Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.064224Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-09T21:11:12.501850Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.064224Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:dc3d9822b4c46693c16c4081ccce5ed8d293403a0eab5407f76d4a3b63b471de","observation_id":"54b849a4-c123-4e9f-aa97-66eab3b96a06","resolution":{"observed_at":"2026-08-05T22:20:47.064224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.18912","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.362413Z","title":null,"venue":null,"work_id":"4989c3e3-54e4-430e-9c34-3b21d0d2c1dc","year":2025},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-09T21:11:12.501850Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.066685Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:96cdfa807dc657c3fcaf3f8df10d0fcc53f7472775777dc16cccad0be725a219","observation_id":"960c9227-348f-408d-a484-7c258e52b061","resolution":{"observed_at":"2026-08-05T22:20:47.367000Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.12701","last_updated":"2020-10-24T02:03:02Z","snapshot_observed_at":"2026-08-09T19:25:14.906256Z","submitted_at":"2020-06-23T02:22:14Z","title":"Unsupervised Sound Separation Using Mixture Invariant Training","version":2},"cited_work":{"arxiv_id":"2006.12701","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.12701","snapshot_observed_at":"2026-08-05T22:20:47.281590Z","title":"Unsupervised Sound Separation Using Mixture Invariant Training","venue":"eess.AS","work_id":"4cdbd37d-2c2d-470d-8088-c753320c6f1e","year":2020},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-09T21:11:12.501850Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.069256Z"},"links":{"cited_paper":"/paper/2006.12701","citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:6bf5e7cc5a69ff9bdf164b0e535e2d390eea99da28346a5ff415f4cf2ed00076","observation_id":"6f0edab2-d0cc-4186-9d23-b62afa23dcae","resolution":{"observed_at":"2026-08-05T22:20:47.285019Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.930989Z","title":null,"venue":null,"work_id":"71609494-cc05-422b-8883-ab820c44c21c","year":2022},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-09T21:11:12.501850Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.072217Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:0d61169fe29a34c52bd1b3d70685585a455545e7ed53c273fef71ab60f2035df","observation_id":"c823310a-bda9-4560-a660-157e8daaa2bb","resolution":{"observed_at":"2026-08-05T22:20:47.934410Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"6027.37548","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.268512Z","title":null,"venue":null,"work_id":"4e3d9a41-a357-4a46-87af-a42f75c3f01e","year":2025},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-09T21:11:12.501850Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.074935Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:59071f581360d5b436bfddb2a6f3a968cd5561f3f1e8a30a723c08a81e220e36","observation_id":"7bf0e5db-cc6b-46e8-994f-3be07df21322","resolution":{"observed_at":"2026-08-05T22:20:47.273669Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.922625Z","title":null,"venue":null,"work_id":"9951f673-39f6-4b48-ae49-b160391cdb40","year":2019},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-09T21:11:12.501850Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.077235Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:f84e5b8f3ed731b29fda3bf72bb012d93626eeb69be2970cbef378e86aa3b92f","observation_id":"464ba9fb-9ffb-4717-9dbb-705c39c31db7","resolution":{"observed_at":"2026-08-05T22:20:47.925641Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.913337Z","title":null,"venue":null,"work_id":"234d8029-0872-4ca9-a22a-3f978d63bbbe","year":2024},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-09T21:11:12.501850Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.079559Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:a07b8d35503a3f4a4d344becea99dcfe360866eded1b5f6d4f6404884bfdaa8e","observation_id":"34cb60da-b0e2-444c-b683-56be10956115","resolution":{"observed_at":"2026-08-05T22:20:47.916295Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.903907Z","title":null,"venue":null,"work_id":"ef2c1106-3597-4efd-a4d7-0c23088e7a59","year":2022},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-09T21:11:12.501850Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.082468Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:24f7b0d558302cbf3b2c6f8ee6a14119b27afa7b282a8a3dca27d75871ede80c","observation_id":"f2ee2bf6-c167-4c40-9d37-378cb28076db","resolution":{"observed_at":"2026-08-05T22:20:47.907254Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.894401Z","title":null,"venue":null,"work_id":"d0869a8d-645b-4a10-8e9f-6c8cc1da1d73","year":2023},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-09T21:11:12.501850Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.084946Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:657873ba28d8ba028d092123e83e59487060fc5307736533cde1c492f9012ff0","observation_id":"cdebe805-f345-4642-b4d6-acee3fdbaefb","resolution":{"observed_at":"2026-08-05T22:20:47.897891Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2607.16260","last_updated":"2026-06-28T11:36:31Z","snapshot_observed_at":"2026-08-05T16:11:36.619314Z","submitted_at":"2026-06-28T11:36:31Z","title":"AdaSurvMamba: Dynamic Fusion and Semantic Scanning for Multimodal Survival Analysis","version":1},"cited_work":{"arxiv_id":"2607.16260","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.16260","snapshot_observed_at":"2026-08-05T22:20:47.196216Z","title":"AdaSurvMamba: Dynamic Fusion and Semantic Scanning for Multimodal Survival Analysis","venue":"cs.LG","work_id":"01390b6f-4cd6-4431-bcda-ec1bc3385f1d","year":2026},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-09T21:11:12.501850Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.087437Z"},"links":{"cited_paper":"/paper/2607.16260","citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:aae2b97ac544fe7c727079b252269003986414545e55ed63abbd861f113b0721","observation_id":"6a557f30-d4e2-4a2a-ad91-3b8ccc4074fd","resolution":{"observed_at":"2026-08-05T22:20:47.200912Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.885703Z","title":null,"venue":null,"work_id":"5c195099-5d71-42b0-8770-31630a253cd4","year":2025},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-09T21:11:12.501850Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.090040Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:ce004d32fb1cf27c181df20e5c644a94c311c32ef924e609652bd538bcfb148c","observation_id":"4aedaf0e-e70f-4906-8549-a657c8daac56","resolution":{"observed_at":"2026-08-05T22:20:47.888680Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.092359Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-09T21:11:12.501850Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.092359Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:aab2b1793864ff48394c9fb7410b015423bb6611af6e87c126710be6befee8cd","observation_id":"9151cad6-6dad-4b5f-8a88-5c291f09c3f4","resolution":{"observed_at":"2026-08-05T22:20:47.092359Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.876564Z","title":null,"venue":null,"work_id":"a848722d-a9bc-4c4b-ab74-676161c2ec16","year":2022},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-09T21:11:12.501850Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.094692Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:11345963a7a5dd4c45b3664a2d0b09a2dc84b3509feaa128fbe40d7016773740","observation_id":"b3c944e5-aa49-4d10-9af3-c857259df8db","resolution":{"observed_at":"2026-08-05T22:20:47.879736Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.867549Z","title":null,"venue":null,"work_id":"5ce9875d-4e51-4b7d-abef-1b1c60bfa992","year":2024},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-09T21:11:12.501850Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.097341Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:0e1f272ab2f0f3f80451f7a278c2271fcd40aa6d0a9d376d799e2e08c3047d13","observation_id":"390e3838-6219-45a6-9edd-408aad9f7ac6","resolution":{"observed_at":"2026-08-05T22:20:47.870895Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:48.036692Z","title":null,"venue":null,"work_id":"8e6de3f3-a702-4c13-aa30-a156860d4e4c","year":2022},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-09T21:11:12.501850Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.017755Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:90f0e2176e77e9d5e9aef86c1b6d067e4144241fbdcb4f67310df70cbd59d41e","observation_id":"047bc0c5-74a4-4faf-83e9-4c453c2aa51a","resolution":{"observed_at":"2026-08-05T22:20:48.040240Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.995662Z","title":"InIEEE/CVF International Conference on Computer Vision","venue":null,"work_id":"a17e7898-f1e3-4994-9486-b3fa87b42f34","year":null},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-09T21:11:12.501850Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.033744Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:2b69d72dc82f7bd8b452b11db3f4fab8499789763a7e9c1c2b5a919856c90429","observation_id":"7b2bcfa8-d413-4937-921f-21fa89b9380a","resolution":{"observed_at":"2026-08-05T22:20:47.999195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:48.063341Z","title":"In Proceedings of the AAAI conference on artificial intelligence, Vol","venue":null,"work_id":"7ccda9bc-587c-46a3-8f85-b220e507786a","year":2067},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-09T21:11:12.501850Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.009539Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:e95a27abac93141f90dc378e9fbc7b822801c3399e9c20f0ab50aec9e382d3f3","observation_id":"afed60a0-0e63-40b4-b603-3ec3d154e629","resolution":{"observed_at":"2026-08-05T22:20:48.067051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","latest_version":1,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-09T21:11:12.501850Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":1,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":37,"verified_exact":6,"verified_fuzzy":2},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 0 inbound Pith citation observations for arXiv:2608.03264."}