{"as_of":"2026-08-18T01:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ef4d73a908a023d9cc73e2458ba5b109e25803bb10fc442dd80540cefcf28460","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T18:15:09.806902Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.08161/citation-record","integrity":"/paper/2412.08161/integrity","json":"/paper/2412.08161/citation-record.json","paper":"/paper/2412.08161"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:09.603740Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08161","last_updated":"2024-12-11T07:33:18Z","snapshot_observed_at":"2026-08-17T21:17:57.501245Z","submitted_at":"2024-12-11T07:33:18Z","title":"Collaborative Hybrid Propagator for Temporal Misalignment in Audio-Visual Segmentation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:09.603740Z"},"links":{"citing_paper":"/paper/2412.08161"},"observation_digest":"sha256:5bbed18a0893390b5511490635f41cf8b760911a418b086633e41e1c0d1ce5e2","observation_id":"24826119-653b-49ff-ada5-425aa64cb6af","resolution":{"observed_at":"2026-08-11T18:15:09.603740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:10.951543Z","title":"Crossvit: Cross-attention multi-scale vision transformer for image classification","venue":null,"work_id":"1d1e5df4-670e-4c03-9cf5-f64d14a2e749","year":2021},"citing_paper":{"arxiv_id":"2412.08161","last_updated":"2024-12-11T07:33:18Z","snapshot_observed_at":"2026-08-17T21:17:57.501245Z","submitted_at":"2024-12-11T07:33:18Z","title":"Collaborative Hybrid Propagator for Temporal Misalignment in Audio-Visual Segmentation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:09.610146Z"},"links":{"citing_paper":"/paper/2412.08161"},"observation_digest":"sha256:82941b9a28f07f48a3126b09b5b7b4bb03d39ccd2ddfa3f59344997a4208979a","observation_id":"a3240496-08ca-4c6b-ae37-072336c3ffe5","resolution":{"observed_at":"2026-08-11T18:15:10.956808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:10.933171Z","title":"Unraveling instance associations: A closer look for audio-visual segmentation, 2024","venue":null,"work_id":"bc2f4320-ca79-47a3-a8f5-92838da35325","year":2024},"citing_paper":{"arxiv_id":"2412.08161","last_updated":"2024-12-11T07:33:18Z","snapshot_observed_at":"2026-08-17T21:17:57.501245Z","submitted_at":"2024-12-11T07:33:18Z","title":"Collaborative Hybrid Propagator for Temporal Misalignment in Audio-Visual Segmentation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:09.615734Z"},"links":{"citing_paper":"/paper/2412.08161"},"observation_digest":"sha256:5b7cdd61b964857ca4fc55f92a6cd0932aff5ed2ccf030e8c59f2e8a47d55a5e","observation_id":"7d6eb9e9-5015-4c17-8b84-4d5db2a2c47e","resolution":{"observed_at":"2026-08-11T18:15:10.940050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:09.621434Z","title":"Blazingly fast video object segmentation with pixel-wise metric learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.08161","last_updated":"2024-12-11T07:33:18Z","snapshot_observed_at":"2026-08-17T21:17:57.501245Z","submitted_at":"2024-12-11T07:33:18Z","title":"Collaborative Hybrid Propagator for Temporal Misalignment in Audio-Visual Segmentation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:09.621434Z"},"links":{"citing_paper":"/paper/2412.08161"},"observation_digest":"sha256:a6e426b121f9c8366ad0a15312cecb0a199ca1d426416a2183926d94ef18916c","observation_id":"cc065afd-e50a-4998-9c91-94a1e6f7185c","resolution":{"observed_at":"2026-08-11T18:15:09.621434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:09.626553Z","title":"The pascal visual object classes (voc) challenge","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.08161","last_updated":"2024-12-11T07:33:18Z","snapshot_observed_at":"2026-08-17T21:17:57.501245Z","submitted_at":"2024-12-11T07:33:18Z","title":"Collaborative Hybrid Propagator for Temporal Misalignment in Audio-Visual Segmentation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:09.626553Z"},"links":{"citing_paper":"/paper/2412.08161"},"observation_digest":"sha256:118d87c0e92863f0ccd28538151dff6849f72739d06dcfc12e42d73fcc286d90","observation_id":"a5e88b11-06d4-4df6-8544-735a7e91e79e","resolution":{"observed_at":"2026-08-11T18:15:09.626553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:10.903611Z","title":"Semi-supervised video object segmentation via learning object-aware global-local correspondence","venue":null,"work_id":"e7a2a661-da27-4c15-baa4-d6c0dcdfc3ed","year":2021},"citing_paper":{"arxiv_id":"2412.08161","last_updated":"2024-12-11T07:33:18Z","snapshot_observed_at":"2026-08-17T21:17:57.501245Z","submitted_at":"2024-12-11T07:33:18Z","title":"Collaborative Hybrid Propagator for Temporal Misalignment in Audio-Visual Segmentation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:09.631873Z"},"links":{"citing_paper":"/paper/2412.08161"},"observation_digest":"sha256:cec64ced22a4da9ab94fbea3c016c91ca64b6317b8d5163766239295297ce0e9","observation_id":"552f43e2-1d57-4e6b-9b75-84f0b61b727a","resolution":{"observed_at":"2026-08-11T18:15:10.909534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:10.886435Z","title":"Avsegformer: Audio-visual segmentation with transformer","venue":null,"work_id":"60f592fc-f1db-4b67-8999-b853dfe4db35","year":2024},"citing_paper":{"arxiv_id":"2412.08161","last_updated":"2024-12-11T07:33:18Z","snapshot_observed_at":"2026-08-17T21:17:57.501245Z","submitted_at":"2024-12-11T07:33:18Z","title":"Collaborative Hybrid Propagator for Temporal Misalignment in Audio-Visual Segmentation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:09.637430Z"},"links":{"citing_paper":"/paper/2412.08161"},"observation_digest":"sha256:11cb46e085292c1fb97346e22b2141a71f2a58e16b6009e2a8d4fee11070f749","observation_id":"1eee0122-c506-4d59-9388-f267b0a6079c","resolution":{"observed_at":"2026-08-11T18:15:10.891760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:10.868883Z","title":"Improving audio-visual segmentation with bidirectional generation, 2023","venue":null,"work_id":"02dd0f46-4893-4456-97b6-4853acb98eff","year":2023},"citing_paper":{"arxiv_id":"2412.08161","last_updated":"2024-12-11T07:33:18Z","snapshot_observed_at":"2026-08-17T21:17:57.501245Z","submitted_at":"2024-12-11T07:33:18Z","title":"Collaborative Hybrid Propagator for Temporal Misalignment in Audio-Visual Segmentation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:09.643129Z"},"links":{"citing_paper":"/paper/2412.08161"},"observation_digest":"sha256:2056b45289947baab9ad389532b379f82b8a35a90c40753724816465ee7720fb","observation_id":"07177b58-95f1-4782-b069-74ba7bd2065f","resolution":{"observed_at":"2026-08-11T18:15:10.874015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:10.852525Z","title":"Improving audio-visual segmentation with bidirectional generation","venue":null,"work_id":"87ac8216-4ce8-48a6-95e9-cd599e604d5d","year":2024},"citing_paper":{"arxiv_id":"2412.08161","last_updated":"2024-12-11T07:33:18Z","snapshot_observed_at":"2026-08-17T21:17:57.501245Z","submitted_at":"2024-12-11T07:33:18Z","title":"Collaborative Hybrid Propagator for Temporal Misalignment in Audio-Visual Segmentation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:09.648097Z"},"links":{"citing_paper":"/paper/2412.08161"},"observation_digest":"sha256:3def3f362892408b1719da4ec1bba176ad15e0d25ac7d70d328e521d7f1b4e21","observation_id":"2fcad426-c203-4d2d-8d35-21003a90a071","resolution":{"observed_at":"2026-08-11T18:15:10.857274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:09.653538Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.08161","last_updated":"2024-12-11T07:33:18Z","snapshot_observed_at":"2026-08-17T21:17:57.501245Z","submitted_at":"2024-12-11T07:33:18Z","title":"Collaborative Hybrid Propagator for Temporal Misalignment in Audio-Visual Segmentation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:09.653538Z"},"links":{"citing_paper":"/paper/2412.08161"},"observation_digest":"sha256:e7c1984246726d65d82650492e17ada0499e4150a70e63acfd1c5a273b350f54","observation_id":"7c5c43c8-bb6f-4fb9-81c7-21f191b98878","resolution":{"observed_at":"2026-08-11T18:15:09.653538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-030-58520-4","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:03:20.376878Z","title":"Interactive video object segmentation using global and local transfer modules","venue":"Lecture notes in computer science","work_id":"0a46ef9d-7501-464c-82ce-b830e213a2a8","year":2020},"citing_paper":{"arxiv_id":"2412.08161","last_updated":"2024-12-11T07:33:18Z","snapshot_observed_at":"2026-08-17T21:17:57.501245Z","submitted_at":"2024-12-11T07:33:18Z","title":"Collaborative Hybrid Propagator for Temporal Misalignment in Audio-Visual Segmentation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:09.658444Z"},"links":{"citing_paper":"/paper/2412.08161"},"observation_digest":"sha256:3a49322c166dc8ca344c6d2d88b0d0d6e89dd89b1dedf374879398016d9ad6ff","observation_id":"4a4fd6e3-f99f-43a4-8f17-15da8c4109c6","resolution":{"observed_at":"2026-08-11T18:15:09.847407Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:10.824421Z","title":"Guided interactive video object segmentation using reliability-based attention maps","venue":null,"work_id":"03a0f01d-68d0-414c-bea2-6241c8d2a3fa","year":2021},"citing_paper":{"arxiv_id":"2412.08161","last_updated":"2024-12-11T07:33:18Z","snapshot_observed_at":"2026-08-17T21:17:57.501245Z","submitted_at":"2024-12-11T07:33:18Z","title":"Collaborative Hybrid Propagator for Temporal Misalignment in Audio-Visual Segmentation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:09.663547Z"},"links":{"citing_paper":"/paper/2412.08161"},"observation_digest":"sha256:ffd20654c33618f11bd062379c81b1dd22ad2930499b399f588d7dcba3bda9ff","observation_id":"3f9f8cae-b331-4ae5-a285-035988f80f90","resolution":{"observed_at":"2026-08-11T18:15:10.829843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:10.806033Z","title":"Cnn architectures for large-scale audio classification","venue":null,"work_id":"f665a7b0-cf11-4dfa-a23d-2157e0e7a877","year":2017},"citing_paper":{"arxiv_id":"2412.08161","last_updated":"2024-12-11T07:33:18Z","snapshot_observed_at":"2026-08-17T21:17:57.501245Z","submitted_at":"2024-12-11T07:33:18Z","title":"Collaborative Hybrid Propagator for Temporal Misalignment in Audio-Visual Segmentation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:09.668331Z"},"links":{"citing_paper":"/paper/2412.08161"},"observation_digest":"sha256:ca7463e2acba5125b756ba25cf404f46328177916368572205f8c40e56ca5a71","observation_id":"a4ba6652-0c34-4300-979e-684d3c2de189","resolution":{"observed_at":"2026-08-11T18:15:10.812602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.09501","last_updated":"2023-09-18T05:58:06Z","snapshot_observed_at":"2026-08-16T14:59:55.725938Z","submitted_at":"2023-09-18T05:58:06Z","title":"Discovering Sounding Objects by Audio Queries for Audio Visual Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.09501","snapshot_observed_at":"2026-08-11T18:15:09.673485Z","title":"Discovering sounding objects by audio queries for audio visual segmentation, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08161","last_updated":"2024-12-11T07:33:18Z","snapshot_observed_at":"2026-08-17T21:17:57.501245Z","submitted_at":"2024-12-11T07:33:18Z","title":"Collaborative Hybrid Propagator for Temporal Misalignment in Audio-Visual Segmentation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:09.673485Z"},"links":{"cited_paper":"/paper/2309.09501","citing_paper":"/paper/2412.08161"},"observation_digest":"sha256:71ea942c8b02cecf062f985f86e32551b8b1a4de58be0ebd30a8687eeb462243","observation_id":"e5d25c6f-dd03-4ae9-b98d-e0c191baaadc","resolution":{"observed_at":"2026-08-11T18:15:09.673485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:10.789064Z","title":"Siamese network with interactive transformer for video object segmentation","venue":null,"work_id":"803256e8-bfa9-4667-b55e-3f8c01d56537","year":2022},"citing_paper":{"arxiv_id":"2412.08161","last_updated":"2024-12-11T07:33:18Z","snapshot_observed_at":"2026-08-17T21:17:57.501245Z","submitted_at":"2024-12-11T07:33:18Z","title":"Collaborative Hybrid Propagator for Temporal Misalignment in Audio-Visual Segmentation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:09.678867Z"},"links":{"citing_paper":"/paper/2412.08161"},"observation_digest":"sha256:e5f5598cac68123c33749dcf0a363f862864a05342807e031b35d27fcaa7f2a9","observation_id":"9748582f-92f7-4c10-9563-d120a180ab51","resolution":{"observed_at":"2026-08-11T18:15:10.794322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:10.772268Z","title":"Catr: Combinatorial-dependence audio-queried transformer for audio-visual video segmentation","venue":null,"work_id":"c20029e8-efd0-4630-93c3-73145e3b46a7","year":2023},"citing_paper":{"arxiv_id":"2412.08161","last_updated":"2024-12-11T07:33:18Z","snapshot_observed_at":"2026-08-17T21:17:57.501245Z","submitted_at":"2024-12-11T07:33:18Z","title":"Collaborative Hybrid Propagator for Temporal Misalignment in Audio-Visual Segmentation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:09.684590Z"},"links":{"citing_paper":"/paper/2412.08161"},"observation_digest":"sha256:c645206bf3ceecea1071d0f4c09434c64918a263f62eb9881e2b1bfe8409be36","observation_id":"d3c43466-ebb9-4428-bc49-2123179322fb","resolution":{"observed_at":"2026-08-11T18:15:10.777174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:10.754355Z","title":"Idpro: Flexible interactive video object segmentation by id-queried concurrent propagation","venue":null,"work_id":"68024810-9a4c-4759-93af-cfb3daa5852c","year":2024},"citing_paper":{"arxiv_id":"2412.08161","last_updated":"2024-12-11T07:33:18Z","snapshot_observed_at":"2026-08-17T21:17:57.501245Z","submitted_at":"2024-12-11T07:33:18Z","title":"Collaborative Hybrid Propagator for Temporal Misalignment in Audio-Visual Segmentation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:09.689397Z"},"links":{"citing_paper":"/paper/2412.08161"},"observation_digest":"sha256:a664681af65f549940a4faf40b94016e4f15fda02f7eb47fae096f5b1eb58f52","observation_id":"0b5a8374-1e3f-40ef-9194-6e4234d386a4","resolution":{"observed_at":"2026-08-11T18:15:10.759800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:10.734220Z","title":"Audio-visual segmentation by exploring cross-modal mutual semantics","venue":null,"work_id":"a486de56-f75f-4773-8a25-5a3eb9bcf9ff","year":2023},"citing_paper":{"arxiv_id":"2412.08161","last_updated":"2024-12-11T07:33:18Z","snapshot_observed_at":"2026-08-17T21:17:57.501245Z","submitted_at":"2024-12-11T07:33:18Z","title":"Collaborative Hybrid Propagator for Temporal Misalignment in Audio-Visual Segmentation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:09.695314Z"},"links":{"citing_paper":"/paper/2412.08161"},"observation_digest":"sha256:77ee68164bb77184206fb838e049aaf721a58a6bcb17262a5f3f974d9a7f03cf","observation_id":"16a822c6-0297-4748-852e-82a6b933ed7d","resolution":{"observed_at":"2026-08-11T18:15:10.740217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:09.700613Z","title":"Bavs: Bootstrapping audio-visual segmentation by integrating foundation knowledge","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08161","last_updated":"2024-12-11T07:33:18Z","snapshot_observed_at":"2026-08-17T21:17:57.501245Z","submitted_at":"2024-12-11T07:33:18Z","title":"Collaborative Hybrid Propagator for Temporal Misalignment in Audio-Visual Segmentation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:09.700613Z"},"links":{"citing_paper":"/paper/2412.08161"},"observation_digest":"sha256:a64912f4c7dad8196cdfdf27442a5a83e89c6a4eee167c8d2b632cb11ba73287","observation_id":"e420a4d3-8e45-4cb4-a19c-58b1d5f18b02","resolution":{"observed_at":"2026-08-11T18:15:09.700613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:10.714452Z","title":"Bavs: bootstrapping audio-visual segmentation by integrating foundation knowledge","venue":null,"work_id":"c4e3314e-7e08-4638-8c0f-c4075ddec3ec","year":2024},"citing_paper":{"arxiv_id":"2412.08161","last_updated":"2024-12-11T07:33:18Z","snapshot_observed_at":"2026-08-17T21:17:57.501245Z","submitted_at":"2024-12-11T07:33:18Z","title":"Collaborative Hybrid Propagator for Temporal Misalignment in Audio-Visual Segmentation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:09.706170Z"},"links":{"citing_paper":"/paper/2412.08161"},"observation_digest":"sha256:5d3b46665b26a6f74e87dfcb30f3e08997d021b9f884eee9e531ca6456f9bd18","observation_id":"3a3814f3-f3ea-44b2-b4fe-202083efaede","resolution":{"observed_at":"2026-08-11T18:15:10.720692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13236","last_updated":"2023-07-25T03:59:04Z","snapshot_observed_at":"2026-08-16T15:13:34.595814Z","submitted_at":"2023-07-25T03:59:04Z","title":"Audio-aware Query-enhanced Transformer for Audio-Visual Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13236","snapshot_observed_at":"2026-08-11T18:15:09.711122Z","title":"Audio-aware query-enhanced transformer for audio-visual segmentation, 2023 b","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08161","last_updated":"2024-12-11T07:33:18Z","snapshot_observed_at":"2026-08-17T21:17:57.501245Z","submitted_at":"2024-12-11T07:33:18Z","title":"Collaborative Hybrid Propagator for Temporal Misalignment in Audio-Visual Segmentation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:09.711122Z"},"links":{"cited_paper":"/paper/2307.13236","citing_paper":"/paper/2412.08161"},"observation_digest":"sha256:9b359b12082454920962d89d7a91417c4c073dbe910b328f7d0ded0208bf9c79","observation_id":"beda460f-bd6e-4a54-b8bf-a5a2029cd3c6","resolution":{"observed_at":"2026-08-11T18:15:09.711122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:10.695725Z","title":"Annotation-free audio-visual segmentation","venue":null,"work_id":"709f26e2-c459-461f-ac3f-597e5d4efbab","year":2024},"citing_paper":{"arxiv_id":"2412.08161","last_updated":"2024-12-11T07:33:18Z","snapshot_observed_at":"2026-08-17T21:17:57.501245Z","submitted_at":"2024-12-11T07:33:18Z","title":"Collaborative Hybrid Propagator for Temporal Misalignment in Audio-Visual Segmentation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:09.716271Z"},"links":{"citing_paper":"/paper/2412.08161"},"observation_digest":"sha256:4c9d77878e2fec8ef866ca4143d7701161b1be342946d38ed3b65dce5481a3bd","observation_id":"e61eed64-33f4-4363-8833-c389285b638f","resolution":{"observed_at":"2026-08-11T18:15:10.701219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16579","last_updated":"2025-07-01T05:44:57Z","snapshot_observed_at":"2026-08-16T15:12:00.870091Z","submitted_at":"2023-07-31T11:29:50Z","title":"Contrastive Conditional Latent Diffusion for Audio-visual Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16579","snapshot_observed_at":"2026-08-11T18:15:09.721140Z","title":"Contrastive conditional latent diffusion for audio-visual segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08161","last_updated":"2024-12-11T07:33:18Z","snapshot_observed_at":"2026-08-17T21:17:57.501245Z","submitted_at":"2024-12-11T07:33:18Z","title":"Collaborative Hybrid Propagator for Temporal Misalignment in Audio-Visual Segmentation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:09.721140Z"},"links":{"cited_paper":"/paper/2307.16579","citing_paper":"/paper/2412.08161"},"observation_digest":"sha256:d2d7b7af4716d54a1114517d7114a031427d858ee6a1757856e83301c380c05e","observation_id":"aaa477f2-e02f-4d79-92c6-b97f59379144","resolution":{"observed_at":"2026-08-11T18:15:09.721140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:10.678306Z","title":"Multimodal variational auto-encoder based audio-visual segmentation","venue":null,"work_id":"4e14e3dd-8b8f-4650-b3b2-8d55beafa978","year":2023},"citing_paper":{"arxiv_id":"2412.08161","last_updated":"2024-12-11T07:33:18Z","snapshot_observed_at":"2026-08-17T21:17:57.501245Z","submitted_at":"2024-12-11T07:33:18Z","title":"Collaborative Hybrid Propagator for Temporal Misalignment in Audio-Visual Segmentation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:09.726858Z"},"links":{"citing_paper":"/paper/2412.08161"},"observation_digest":"sha256:da156edfed03b5869460f43272b57da54e364280da1602d08881bf4bf906fda5","observation_id":"5e55b5d7-6eec-4eee-be13-5446d126c590","resolution":{"observed_at":"2026-08-11T18:15:10.684644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:10.662079Z","title":"Weakly-supervised audio-visual segmentation","venue":null,"work_id":"cd969bbe-85a2-4169-bbf9-d74d39073374","year":2024},"citing_paper":{"arxiv_id":"2412.08161","last_updated":"2024-12-11T07:33:18Z","snapshot_observed_at":"2026-08-17T21:17:57.501245Z","submitted_at":"2024-12-11T07:33:18Z","title":"Collaborative Hybrid Propagator for Temporal Misalignment in Audio-Visual Segmentation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:09.732122Z"},"links":{"citing_paper":"/paper/2412.08161"},"observation_digest":"sha256:ac59c89cc94db01de47b9ed4cc3069f0b456b06df0841e6dc62cbf35266f22dc","observation_id":"04ecdfc8-7be9-4cbb-b4cc-c94c07253e08","resolution":{"observed_at":"2026-08-11T18:15:10.667494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:09.736557Z","title":"Video object segmentation using space-time memory networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.08161","last_updated":"2024-12-11T07:33:18Z","snapshot_observed_at":"2026-08-17T21:17:57.501245Z","submitted_at":"2024-12-11T07:33:18Z","title":"Collaborative Hybrid Propagator for Temporal Misalignment in Audio-Visual Segmentation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:09.736557Z"},"links":{"citing_paper":"/paper/2412.08161"},"observation_digest":"sha256:61a91fa1e0c45d87c8d3dc2352ba63087e6a0c8ca43e0f5f538e80d3ee8d7ed8","observation_id":"abb52605-e31e-4b0d-9947-7fb2ec27c2a7","resolution":{"observed_at":"2026-08-11T18:15:09.736557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01197","last_updated":"2023-12-03T23:57:43Z","snapshot_observed_at":"2026-08-16T15:19:04.611372Z","submitted_at":"2023-07-03T17:58:01Z","title":"Segment Anything Meets Point Tracking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01197","snapshot_observed_at":"2026-08-11T18:15:09.741484Z","title":"Segment anything meets point tracking","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08161","last_updated":"2024-12-11T07:33:18Z","snapshot_observed_at":"2026-08-17T21:17:57.501245Z","submitted_at":"2024-12-11T07:33:18Z","title":"Collaborative Hybrid Propagator for Temporal Misalignment in Audio-Visual Segmentation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:09.741484Z"},"links":{"cited_paper":"/paper/2307.01197","citing_paper":"/paper/2412.08161"},"observation_digest":"sha256:452d28404e6e7398b60ef8018f7fc0290ae243c92a8994beccc01e2363fa3545","observation_id":"d41f58e3-1d67-4218-825b-f4e817156a3b","resolution":{"observed_at":"2026-08-11T18:15:09.741484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:10.643759Z","title":"Self-supervised audio-visual co-segmentation","venue":null,"work_id":"5504b9f1-cdee-450d-97cf-f7eae2312133","year":2019},"citing_paper":{"arxiv_id":"2412.08161","last_updated":"2024-12-11T07:33:18Z","snapshot_observed_at":"2026-08-17T21:17:57.501245Z","submitted_at":"2024-12-11T07:33:18Z","title":"Collaborative Hybrid Propagator for Temporal Misalignment in Audio-Visual Segmentation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:09.747814Z"},"links":{"citing_paper":"/paper/2412.08161"},"observation_digest":"sha256:617ca328b5b2b4d15edf45f3fb906ba30458fefc0b956fb1df42e1ac5e3a3c04","observation_id":"58f04c43-6a6f-4a1b-ac2f-b79b79803016","resolution":{"observed_at":"2026-08-11T18:15:10.650102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:09.752921Z","title":"Revisiting click-based interactive video object segmentation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08161","last_updated":"2024-12-11T07:33:18Z","snapshot_observed_at":"2026-08-17T21:17:57.501245Z","submitted_at":"2024-12-11T07:33:18Z","title":"Collaborative Hybrid Propagator for Temporal Misalignment in Audio-Visual Segmentation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:09.752921Z"},"links":{"citing_paper":"/paper/2412.08161"},"observation_digest":"sha256:44b634c450c2e3ef4271db49ff4edbdb94c258b3b100b3c3b41e5790939b6a56","observation_id":"a62e9707-0482-41f9-ae04-f70bd9a8180a","resolution":{"observed_at":"2026-08-11T18:15:09.752921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:10.625157Z","title":"Pyramid vision transformer: A versatile backbone for dense prediction without convolutions","venue":null,"work_id":"bae10b6b-f865-4692-86c7-ff1f99f87f8f","year":2021},"citing_paper":{"arxiv_id":"2412.08161","last_updated":"2024-12-11T07:33:18Z","snapshot_observed_at":"2026-08-17T21:17:57.501245Z","submitted_at":"2024-12-11T07:33:18Z","title":"Collaborative Hybrid Propagator for Temporal Misalignment in Audio-Visual Segmentation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:09.758059Z"},"links":{"citing_paper":"/paper/2412.08161"},"observation_digest":"sha256:797c0b40b630df4796793136705b8d16a5a87318ab7f9111e7edcff2e89ed52b","observation_id":"6cb0cb6b-b39e-49f3-a03a-7534e05ce50f","resolution":{"observed_at":"2026-08-11T18:15:10.630849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06462","last_updated":"2024-04-07T14:05:53Z","snapshot_observed_at":"2026-08-16T14:35:50.547722Z","submitted_at":"2023-12-11T15:51:38Z","title":"Cooperation Does Matter: Exploring Multi-Order Bilateral Relations for Audio-Visual Segmentation","version":2},"cited_work":{"arxiv_id":"2312.06462","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.06462","snapshot_observed_at":"2026-08-11T18:15:10.082260Z","title":"Cooperation Does Matter: Exploring Multi-Order Bilateral Relations for Audio-Visual Segmentation","venue":"cs.CV","work_id":"58ec46f1-5170-49cf-b7ac-86acc8e79574","year":2023},"citing_paper":{"arxiv_id":"2412.08161","last_updated":"2024-12-11T07:33:18Z","snapshot_observed_at":"2026-08-17T21:17:57.501245Z","submitted_at":"2024-12-11T07:33:18Z","title":"Collaborative Hybrid Propagator for Temporal Misalignment in Audio-Visual Segmentation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:09.762827Z"},"links":{"cited_paper":"/paper/2312.06462","citing_paper":"/paper/2412.08161"},"observation_digest":"sha256:8c3f10fc65afef962c70f9d354ab3ebfea1dd5f1962e633eb2c17481aa2d1bd4","observation_id":"b3c837c0-124a-4ad1-ab11-b250b7130b64","resolution":{"observed_at":"2026-08-11T18:15:10.088665Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:10.607085Z","title":"Associating objects with transformers for video object segmentation","venue":null,"work_id":"82c7942d-11c9-47c5-9dbd-f57addeaec4e","year":2021},"citing_paper":{"arxiv_id":"2412.08161","last_updated":"2024-12-11T07:33:18Z","snapshot_observed_at":"2026-08-17T21:17:57.501245Z","submitted_at":"2024-12-11T07:33:18Z","title":"Collaborative Hybrid Propagator for Temporal Misalignment in Audio-Visual Segmentation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:09.768748Z"},"links":{"citing_paper":"/paper/2412.08161"},"observation_digest":"sha256:2c5e933c7b1b77b6c45cad89049af994b548cec27dbc397c89747b38a03e0c70","observation_id":"fcafd55e-50df-4628-b6a7-bbdc41cd8250","resolution":{"observed_at":"2026-08-11T18:15:10.612905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:10.587017Z","title":"Learning to recommend frame for interactive video object segmentation in the wild, 2021","venue":null,"work_id":"c681b4df-ebfe-450c-bf29-1e10205c38f9","year":2021},"citing_paper":{"arxiv_id":"2412.08161","last_updated":"2024-12-11T07:33:18Z","snapshot_observed_at":"2026-08-17T21:17:57.501245Z","submitted_at":"2024-12-11T07:33:18Z","title":"Collaborative Hybrid Propagator for Temporal Misalignment in Audio-Visual Segmentation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:09.773707Z"},"links":{"citing_paper":"/paper/2412.08161"},"observation_digest":"sha256:49e08c0b07cbbb8ccc9ec27e67cc7a7cc1d7ea585593f429976f11ec9f6de9a8","observation_id":"810a2e71-3954-4287-9160-80fb5c63d3df","resolution":{"observed_at":"2026-08-11T18:15:10.592957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:10.569015Z","title":"Audio--visual segmentation","venue":null,"work_id":"aff4116f-b3e7-4558-b914-b58416991691","year":2022},"citing_paper":{"arxiv_id":"2412.08161","last_updated":"2024-12-11T07:33:18Z","snapshot_observed_at":"2026-08-17T21:17:57.501245Z","submitted_at":"2024-12-11T07:33:18Z","title":"Collaborative Hybrid Propagator for Temporal Misalignment in Audio-Visual Segmentation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:09.778592Z"},"links":{"citing_paper":"/paper/2412.08161"},"observation_digest":"sha256:991a69e13929d7d7ccd139e1a40854e487c254f18f798c2d2d74685db8822474","observation_id":"14cd38e2-0689-4359-a8b4-d9afe851e9a4","resolution":{"observed_at":"2026-08-11T18:15:10.575112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13190","last_updated":"2023-01-30T18:53:32Z","snapshot_observed_at":"2026-08-16T15:59:03.490415Z","submitted_at":"2023-01-30T18:53:32Z","title":"Audio-Visual Segmentation with Semantics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.13190","snapshot_observed_at":"2026-08-11T18:15:09.783584Z","title":"Audio-visual segmentation with semantics","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08161","last_updated":"2024-12-11T07:33:18Z","snapshot_observed_at":"2026-08-17T21:17:57.501245Z","submitted_at":"2024-12-11T07:33:18Z","title":"Collaborative Hybrid Propagator for Temporal Misalignment in Audio-Visual Segmentation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:09.783584Z"},"links":{"cited_paper":"/paper/2301.13190","citing_paper":"/paper/2412.08161"},"observation_digest":"sha256:c25e7997fa0a9506b4eedf62b584cead1ba16c6bd65408a3d96fef7b2386ec9d","observation_id":"2d60e907-1263-47cb-bdd6-081ebda6d612","resolution":{"observed_at":"2026-08-11T18:15:09.783584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:10.551887Z","title":"Separable structure modeling for semi-supervised video object segmentation","venue":null,"work_id":"35679e38-ddb3-4895-b421-fd919220dd9c","year":2021},"citing_paper":{"arxiv_id":"2412.08161","last_updated":"2024-12-11T07:33:18Z","snapshot_observed_at":"2026-08-17T21:17:57.501245Z","submitted_at":"2024-12-11T07:33:18Z","title":"Collaborative Hybrid Propagator for Temporal Misalignment in Audio-Visual Segmentation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:09.790023Z"},"links":{"citing_paper":"/paper/2412.08161"},"observation_digest":"sha256:05f5abe53d5814c538729d1f0889111a8e9c1986fcf268121652cf184946dbc5","observation_id":"88882f19-a3a7-4ff8-8149-9165ed52f58e","resolution":{"observed_at":"2026-08-11T18:15:10.557188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:09.795182Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08161","last_updated":"2024-12-11T07:33:18Z","snapshot_observed_at":"2026-08-17T21:17:57.501245Z","submitted_at":"2024-12-11T07:33:18Z","title":"Collaborative Hybrid Propagator for Temporal Misalignment in Audio-Visual Segmentation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:09.795182Z"},"links":{"citing_paper":"/paper/2412.08161"},"observation_digest":"sha256:29a4750ccb95f9436b59f318138e9399a7c0de6ea0999fac9fe73e432dadfb41","observation_id":"7e3d34ab-9949-43bf-bbad-ec6100920481","resolution":{"observed_at":"2026-08-11T18:15:09.795182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:09.801134Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08161","last_updated":"2024-12-11T07:33:18Z","snapshot_observed_at":"2026-08-17T21:17:57.501245Z","submitted_at":"2024-12-11T07:33:18Z","title":"Collaborative Hybrid Propagator for Temporal Misalignment in Audio-Visual Segmentation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:09.801134Z"},"links":{"citing_paper":"/paper/2412.08161"},"observation_digest":"sha256:1063fd3ce31ce857882f251516831f6aad4279ded5e015148ca6525c3da7442d","observation_id":"fa49b443-085e-4ce8-a23b-9b0493fc6414","resolution":{"observed_at":"2026-08-11T18:15:09.801134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:15:09.806902Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08161","last_updated":"2024-12-11T07:33:18Z","snapshot_observed_at":"2026-08-17T21:17:57.501245Z","submitted_at":"2024-12-11T07:33:18Z","title":"Collaborative Hybrid Propagator for Temporal Misalignment in Audio-Visual Segmentation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T18:15:09.806902Z"},"links":{"citing_paper":"/paper/2412.08161"},"observation_digest":"sha256:62605e3a85b1059ef3871e14cd10a4e444601d856e8390a2d729342a39c7c8ba","observation_id":"9a0f5467-9c77-43c0-82e6-c392e2b265dc","resolution":{"observed_at":"2026-08-11T18:15:09.806902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.08161","last_updated":"2024-12-11T07:33:18Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T21:17:57.501245Z","submitted_at":"2024-12-11T07:33:18Z","title":"Collaborative Hybrid Propagator for Temporal Misalignment in Audio-Visual Segmentation"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":2,"verified_fuzzy":22},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2412.08161."}