{"as_of":"2026-08-15T12:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:290dab5a663d290cc49b6880e741adece678850071aa687d2570450dfb62c4c8","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T04:42:30.341132Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T12:08:16.065856Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T05:09:31.997736Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.01136","last_updated":"2025-03-26T08:59:35Z","snapshot_observed_at":"2026-08-13T18:07:18.687056Z","submitted_at":"2024-12-02T05:20:35Z","title":"Referring Video Object Segmentation via Language-aligned Track Selection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01136","snapshot_observed_at":"2026-08-06T12:08:16.065856Z","title":"Referring video object segmentation via language-aligned track selection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22061","last_updated":"2025-07-29T17:59:35Z","snapshot_observed_at":"2026-08-15T01:12:41.791079Z","submitted_at":"2025-07-29T17:59:35Z","title":"MOVE: Motion-Guided Few-Shot Video Object Segmentation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T12:08:16.065856Z"},"links":{"cited_paper":"/paper/2412.01136","citing_paper":"/paper/2507.22061"},"observation_digest":"sha256:617ce2968ad6d22bb1d0f4c8f895bc7b7f271f4fcc88b0d9c9858a817c324201","observation_id":"ec8a01c8-6981-4e8b-8e64-4b8fa22f65bb","resolution":{"observed_at":"2026-08-06T12:08:16.065856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01136","last_updated":"2025-03-26T08:59:35Z","snapshot_observed_at":"2026-08-13T18:07:18.687056Z","submitted_at":"2024-12-02T05:20:35Z","title":"Referring Video Object Segmentation via Language-aligned Track Selection","version":2},"cited_work":{"arxiv_id":"2412.01136","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.01136","snapshot_observed_at":"2026-08-05T05:09:31.997736Z","title":"Referring Video Object Segmentation via Language-aligned Track Selection","venue":"cs.CV","work_id":"cc56b417-7c0b-47e1-ad66-22b75d4585ef","year":2024},"citing_paper":{"arxiv_id":"2509.05751","last_updated":"2025-09-06T15:46:23Z","snapshot_observed_at":"2026-08-15T08:40:32.434597Z","submitted_at":"2025-09-06T15:46:23Z","title":"Unleashing Hierarchical Reasoning: An LLM-Driven Framework for Training-Free Referring Video Object Segmentation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T05:09:31.671155Z"},"links":{"cited_paper":"/paper/2412.01136","citing_paper":"/paper/2509.05751"},"observation_digest":"sha256:841356212359fc9acf79aa7fd13931746408c708f9ad80ebe21f5bf90958e82f","observation_id":"cff9ce97-b9ba-401e-82fe-fa7684435c61","resolution":{"observed_at":"2026-08-05T05:09:32.003729Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.01136/citation-record","integrity":"/paper/2412.01136/integrity","json":"/paper/2412.01136/citation-record.json","paper":"/paper/2412.01136"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T04:42:30.187102Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01136","last_updated":"2025-03-26T08:59:35Z","snapshot_observed_at":"2026-08-13T18:07:18.687056Z","submitted_at":"2024-12-02T05:20:35Z","title":"Referring Video Object Segmentation via Language-aligned Track Selection","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T04:42:30.187102Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.01136"},"observation_digest":"sha256:2174ffc92d4e63319f8e5edcbf6b12e927c2dbffdab03dddec1b15debf914f6f","observation_id":"72b3f13b-d469-49cc-af3f-03b302024ed0","resolution":{"observed_at":"2026-08-12T04:42:30.187102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:42:31.049719Z","title":"End-to-end referring video object segmentation with mul- timodal transformers","venue":null,"work_id":"afdec8ef-2f4e-4d5a-b27e-09fc49d4520b","year":2022},"citing_paper":{"arxiv_id":"2412.01136","last_updated":"2025-03-26T08:59:35Z","snapshot_observed_at":"2026-08-13T18:07:18.687056Z","submitted_at":"2024-12-02T05:20:35Z","title":"Referring Video Object Segmentation via Language-aligned Track Selection","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T04:42:30.192902Z"},"links":{"citing_paper":"/paper/2412.01136"},"observation_digest":"sha256:6bcd42ca627ea664a4f7087f1dec006907c05334e6850a0e432985a9a74528ba","observation_id":"7aedcaaa-2530-4ba2-8bfd-3eca2b38a316","resolution":{"observed_at":"2026-08-12T04:42:31.055324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:42:31.034734Z","title":"Vision-language transformer and query generation for refer- ring segmentation","venue":null,"work_id":"ab01b72d-88b4-42f2-a096-43528ad0570f","year":2021},"citing_paper":{"arxiv_id":"2412.01136","last_updated":"2025-03-26T08:59:35Z","snapshot_observed_at":"2026-08-13T18:07:18.687056Z","submitted_at":"2024-12-02T05:20:35Z","title":"Referring Video Object Segmentation via Language-aligned Track Selection","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T04:42:30.198030Z"},"links":{"citing_paper":"/paper/2412.01136"},"observation_digest":"sha256:140c6f07f76da99b52d8a905a10bd9cc728e6634b39f4cc73d6eca20ea7e3c8d","observation_id":"2e5a6799-73e8-4236-97bb-42b1e1f4627f","resolution":{"observed_at":"2026-08-12T04:42:31.039986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:42:31.016777Z","title":"Mevis: A large-scale benchmark for video segmentation with motion expressions","venue":null,"work_id":"45ce1860-3d6a-440f-a0fa-62ea9b09aafe","year":2023},"citing_paper":{"arxiv_id":"2412.01136","last_updated":"2025-03-26T08:59:35Z","snapshot_observed_at":"2026-08-13T18:07:18.687056Z","submitted_at":"2024-12-02T05:20:35Z","title":"Referring Video Object Segmentation via Language-aligned Track Selection","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T04:42:30.203375Z"},"links":{"citing_paper":"/paper/2412.01136"},"observation_digest":"sha256:25187ce41f05c937627046c8604ac6348206513d393bfc837386b56f69a50f71","observation_id":"021f977b-b978-4745-96c1-a0bf0c45470d","resolution":{"observed_at":"2026-08-12T04:42:31.023971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:42:30.997701Z","title":"Language-bridged spatial-temporal interaction for referring video object segmentation","venue":null,"work_id":"8d49c01c-b7f7-4982-b0b2-e6a4510f5d2c","year":2022},"citing_paper":{"arxiv_id":"2412.01136","last_updated":"2025-03-26T08:59:35Z","snapshot_observed_at":"2026-08-13T18:07:18.687056Z","submitted_at":"2024-12-02T05:20:35Z","title":"Referring Video Object Segmentation via Language-aligned Track Selection","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T04:42:30.208440Z"},"links":{"citing_paper":"/paper/2412.01136"},"observation_digest":"sha256:5eaee32d9acc5373f9fcec8cd2d88ddd1317b47bd0db7177f8a28861e204b676","observation_id":"e8af9f4e-02b6-4310-813e-d1c9fe1ff8ca","resolution":{"observed_at":"2026-08-12T04:42:31.003957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:42:30.979931Z","title":"The pascal visual object classes (voc) challenge","venue":null,"work_id":"0086016b-838e-4d6f-b90e-296ca0046423","year":2010},"citing_paper":{"arxiv_id":"2412.01136","last_updated":"2025-03-26T08:59:35Z","snapshot_observed_at":"2026-08-13T18:07:18.687056Z","submitted_at":"2024-12-02T05:20:35Z","title":"Referring Video Object Segmentation via Language-aligned Track Selection","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T04:42:30.213445Z"},"links":{"citing_paper":"/paper/2412.01136"},"observation_digest":"sha256:6d2625f3a2d0bbdb62c6eb876c91f81e1bfa31c095914d63b290874404911b77","observation_id":"ee750bb6-3a96-4573-bdf1-84b2f0fed86c","resolution":{"observed_at":"2026-08-12T04:42:30.985638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:42:30.963538Z","title":"Actor and action video segmentation from a sen- tence","venue":null,"work_id":"08bba233-6cd9-46ab-97fc-99f833532fc9","year":2018},"citing_paper":{"arxiv_id":"2412.01136","last_updated":"2025-03-26T08:59:35Z","snapshot_observed_at":"2026-08-13T18:07:18.687056Z","submitted_at":"2024-12-02T05:20:35Z","title":"Referring Video Object Segmentation via Language-aligned Track Selection","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T04:42:30.220559Z"},"links":{"citing_paper":"/paper/2412.01136"},"observation_digest":"sha256:3a47d237569959789e471252dd125dde68d23970c38511e5c817ca96e7a7a315","observation_id":"2e25aaf5-ba70-495e-9386-7bcf1ceb2269","resolution":{"observed_at":"2026-08-12T04:42:30.969164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:42:30.946116Z","title":"Html: Hybrid temporal-scale mul- timodal learning framework for referring video object seg- mentation","venue":null,"work_id":"ffbd95fb-c5b3-46be-b5b3-a43ae8225692","year":2023},"citing_paper":{"arxiv_id":"2412.01136","last_updated":"2025-03-26T08:59:35Z","snapshot_observed_at":"2026-08-13T18:07:18.687056Z","submitted_at":"2024-12-02T05:20:35Z","title":"Referring Video Object Segmentation via Language-aligned Track Selection","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T04:42:30.228708Z"},"links":{"citing_paper":"/paper/2412.01136"},"observation_digest":"sha256:98f8caf059412103668f5f9a2e929c44f97d9b64f0a46aea57aad0a84e5e694a","observation_id":"ce2302a8-491a-4ef8-8d50-72b4a0c643a7","resolution":{"observed_at":"2026-08-12T04:42:30.951065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:42:30.928901Z","title":"Decoupling static and hier- archical motion perception for referring video segmentation","venue":null,"work_id":"8b018db0-d154-4352-a8b4-5aa4a67256b9","year":2024},"citing_paper":{"arxiv_id":"2412.01136","last_updated":"2025-03-26T08:59:35Z","snapshot_observed_at":"2026-08-13T18:07:18.687056Z","submitted_at":"2024-12-02T05:20:35Z","title":"Referring Video Object Segmentation via Language-aligned Track Selection","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T04:42:30.233906Z"},"links":{"citing_paper":"/paper/2412.01136"},"observation_digest":"sha256:6cbe58557d933327cd595ca90b9238998043b891d49633d1cfdc6dc2d08e74e0","observation_id":"5ba59491-4c49-46a1-8788-8e9f46a22f65","resolution":{"observed_at":"2026-08-12T04:42:30.934513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1903.12261","last_updated":"2019-03-28T20:56:37Z","snapshot_observed_at":"2026-08-15T10:34:34.836991Z","submitted_at":"2019-03-28T20:56:37Z","title":"Benchmarking Neural Network Robustness to Common Corruptions and Perturbations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.12261","snapshot_observed_at":"2026-08-12T04:42:30.238720Z","title":"Benchmarking neu- ral network robustness to common corruptions and perturba- tions","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2412.01136","last_updated":"2025-03-26T08:59:35Z","snapshot_observed_at":"2026-08-13T18:07:18.687056Z","submitted_at":"2024-12-02T05:20:35Z","title":"Referring Video Object Segmentation via Language-aligned Track Selection","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T04:42:30.238720Z"},"links":{"cited_paper":"/paper/1903.12261","citing_paper":"/paper/2412.01136"},"observation_digest":"sha256:12495510fedd15dec9f181037498a7808fd4998c14215ebb53b00edaa4c8c61a","observation_id":"72a94c27-7bf6-4408-8487-2d83cf546cdf","resolution":{"observed_at":"2026-08-12T04:42:30.238720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15876","last_updated":"2024-12-23T08:10:30Z","snapshot_observed_at":"2026-08-15T10:32:57.840402Z","submitted_at":"2024-08-28T15:47:32Z","title":"Unleashing the Temporal-Spatial Reasoning Capacity of GPT for Training-Free Audio and Language Referenced Video Object Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15876","snapshot_observed_at":"2026-08-12T04:42:30.243704Z","title":"Unleashing the temporal-spatial reasoning capacity of gpt for training-free audio and language referenced video object segmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01136","last_updated":"2025-03-26T08:59:35Z","snapshot_observed_at":"2026-08-13T18:07:18.687056Z","submitted_at":"2024-12-02T05:20:35Z","title":"Referring Video Object Segmentation via Language-aligned Track Selection","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T04:42:30.243704Z"},"links":{"cited_paper":"/paper/2408.15876","citing_paper":"/paper/2412.01136"},"observation_digest":"sha256:90299c2e01bfae5fd6676233739b2120296e2c52305c13689d4bf2f516eaf104","observation_id":"41c97bf8-dcb4-4d16-ac06-e2152538a441","resolution":{"observed_at":"2026-08-12T04:42:30.243704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:42:30.910315Z","title":"Scaling up visual and vision-language representa- tion learning with noisy text supervision","venue":null,"work_id":"054660a7-c9bf-4428-b1a9-91b224f42968","year":null},"citing_paper":{"arxiv_id":"2412.01136","last_updated":"2025-03-26T08:59:35Z","snapshot_observed_at":"2026-08-13T18:07:18.687056Z","submitted_at":"2024-12-02T05:20:35Z","title":"Referring Video Object Segmentation via Language-aligned Track Selection","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T04:42:30.249752Z"},"links":{"citing_paper":"/paper/2412.01136"},"observation_digest":"sha256:33f7c192a96433502066206bff796b90486aeed3aec48d91a24b5a525177ffbb","observation_id":"4b34fb5a-31c7-4a10-a5f1-1511cd520211","resolution":{"observed_at":"2026-08-12T04:42:30.915946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:42:30.893465Z","title":"Video object segmentation with language referring expressions","venue":null,"work_id":"24893e6a-bb31-4abb-87c5-7e777b151aa7","year":2018},"citing_paper":{"arxiv_id":"2412.01136","last_updated":"2025-03-26T08:59:35Z","snapshot_observed_at":"2026-08-13T18:07:18.687056Z","submitted_at":"2024-12-02T05:20:35Z","title":"Referring Video Object Segmentation via Language-aligned Track Selection","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T04:42:30.254626Z"},"links":{"citing_paper":"/paper/2412.01136"},"observation_digest":"sha256:a1e9ba56e9dbc3915b980926d81a3e46f6d41ffb299b5d405ee228c67a1a699c","observation_id":"19fee968-32f3-468c-a432-a56361293f7d","resolution":{"observed_at":"2026-08-12T04:42:30.899243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:42:30.876637Z","title":"Video object segmentation with language referring expressions","venue":null,"work_id":"1c57d9f3-d4b0-4ed1-a9c5-7429241f1be2","year":2019},"citing_paper":{"arxiv_id":"2412.01136","last_updated":"2025-03-26T08:59:35Z","snapshot_observed_at":"2026-08-13T18:07:18.687056Z","submitted_at":"2024-12-02T05:20:35Z","title":"Referring Video Object Segmentation via Language-aligned Track Selection","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T04:42:30.259230Z"},"links":{"citing_paper":"/paper/2412.01136"},"observation_digest":"sha256:306f105d3d45d9b53d2894a176ad6fac69a9d8de9598b7fa7a163b66d6abd0cc","observation_id":"5c37430b-569c-4528-b8ca-035f1ecc81c4","resolution":{"observed_at":"2026-08-12T04:42:30.881871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:42:30.264270Z","title":"Segment any- thing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01136","last_updated":"2025-03-26T08:59:35Z","snapshot_observed_at":"2026-08-13T18:07:18.687056Z","submitted_at":"2024-12-02T05:20:35Z","title":"Referring Video Object Segmentation via Language-aligned Track Selection","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T04:42:30.264270Z"},"links":{"citing_paper":"/paper/2412.01136"},"observation_digest":"sha256:edc8ef5936c00e6a9ab368e35d1425a8b4146546e99d371bcd388b6c7b1cba7b","observation_id":"a9ab9048-f549-47f7-aca3-3a4c9a07bc0a","resolution":{"observed_at":"2026-08-12T04:42:30.264270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:42:30.850473Z","title":"Referring image seg- mentation via recurrent refinement networks","venue":null,"work_id":"cb6a8987-403f-4298-807f-16f40f5c6359","year":2018},"citing_paper":{"arxiv_id":"2412.01136","last_updated":"2025-03-26T08:59:35Z","snapshot_observed_at":"2026-08-13T18:07:18.687056Z","submitted_at":"2024-12-02T05:20:35Z","title":"Referring Video Object Segmentation via Language-aligned Track Selection","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T04:42:30.268630Z"},"links":{"citing_paper":"/paper/2412.01136"},"observation_digest":"sha256:91524d7e61bdefcc52ac3e7dc20484de46f76688240a983444f244b7cfa17cb8","observation_id":"2102bee9-3c31-493a-a017-c3540bfab65e","resolution":{"observed_at":"2026-08-12T04:42:30.855992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:42:30.833351Z","title":"Robust referring video object segmentation with cyclic structural consensus","venue":null,"work_id":"5ec36bfa-4796-49be-8dd1-ab432d49e3b2","year":2023},"citing_paper":{"arxiv_id":"2412.01136","last_updated":"2025-03-26T08:59:35Z","snapshot_observed_at":"2026-08-13T18:07:18.687056Z","submitted_at":"2024-12-02T05:20:35Z","title":"Referring Video Object Segmentation via Language-aligned Track Selection","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T04:42:30.273139Z"},"links":{"citing_paper":"/paper/2412.01136"},"observation_digest":"sha256:164a224316974a3b7e90fe32a68da557c227b8a48bef1d851802be19538371fe","observation_id":"c5ebdb6e-1be1-4721-acbe-1f04f1af376b","resolution":{"observed_at":"2026-08-12T04:42:30.838830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.00997","last_updated":"2024-09-03T07:25:51Z","snapshot_observed_at":"2026-08-13T11:03:47.348490Z","submitted_at":"2023-07-03T13:21:58Z","title":"RefSAM: Efficiently Adapting Segmenting Anything Model for Referring Video Object Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.00997","snapshot_observed_at":"2026-08-12T04:42:30.278910Z","title":"Refsam: Efficiently adapting segmenting any- thing model for referring video object segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01136","last_updated":"2025-03-26T08:59:35Z","snapshot_observed_at":"2026-08-13T18:07:18.687056Z","submitted_at":"2024-12-02T05:20:35Z","title":"Referring Video Object Segmentation via Language-aligned Track Selection","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T04:42:30.278910Z"},"links":{"cited_paper":"/paper/2307.00997","citing_paper":"/paper/2412.01136"},"observation_digest":"sha256:12ff1f6c05dd2b580402ebdb9d6d5b1f87f1f1e1e334abbc071e836c63e1dc2d","observation_id":"c5366fd6-a2d9-4667-8ec4-f8cfbac51261","resolution":{"observed_at":"2026-08-12T04:42:30.278910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-12T04:42:30.285147Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01136","last_updated":"2025-03-26T08:59:35Z","snapshot_observed_at":"2026-08-13T18:07:18.687056Z","submitted_at":"2024-12-02T05:20:35Z","title":"Referring Video Object Segmentation via Language-aligned Track Selection","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T04:42:30.285147Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2412.01136"},"observation_digest":"sha256:fe1cacbd5c0a4649fed6227b8a8e9e9f7d3d5792aa6841bb019d3701821e1b75","observation_id":"c146b9a3-2a06-4a09-b7ce-677443afd363","resolution":{"observed_at":"2026-08-12T04:42:30.285147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-12T04:42:30.292818Z","title":"Roberta: A robustly optimized BERT pretraining approach","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2412.01136","last_updated":"2025-03-26T08:59:35Z","snapshot_observed_at":"2026-08-13T18:07:18.687056Z","submitted_at":"2024-12-02T05:20:35Z","title":"Referring Video Object Segmentation via Language-aligned Track Selection","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T04:42:30.292818Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2412.01136"},"observation_digest":"sha256:5d16e9cecf8c9b30bfc2d47b0db1da4c04ef19803770958d3089fbf1e7edf53c","observation_id":"70c4a044-c2b8-473a-85f6-7cd0364320c3","resolution":{"observed_at":"2026-08-12T04:42:30.292818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:42:30.814071Z","title":"Temporally consistent referring video object segmentation with hybrid memory","venue":null,"work_id":"374e1d23-45e5-4cc3-8755-790f104250f7","year":2024},"citing_paper":{"arxiv_id":"2412.01136","last_updated":"2025-03-26T08:59:35Z","snapshot_observed_at":"2026-08-13T18:07:18.687056Z","submitted_at":"2024-12-02T05:20:35Z","title":"Referring Video Object Segmentation via Language-aligned Track Selection","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T04:42:30.298412Z"},"links":{"citing_paper":"/paper/2412.01136"},"observation_digest":"sha256:84601b37da0b78bb1cef80f2f65ea76f55215e66eb45f9a441075577a9a5eb7e","observation_id":"af574789-eae5-4493-ab62-1d0c2fe1bb50","resolution":{"observed_at":"2026-08-12T04:42:30.821262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:42:30.795661Z","title":"Efficient non- maximum suppression","venue":null,"work_id":"00e89bf4-ae81-43ba-84b2-914b8eae0b15","year":2006},"citing_paper":{"arxiv_id":"2412.01136","last_updated":"2025-03-26T08:59:35Z","snapshot_observed_at":"2026-08-13T18:07:18.687056Z","submitted_at":"2024-12-02T05:20:35Z","title":"Referring Video Object Segmentation via Language-aligned Track Selection","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T04:42:30.304055Z"},"links":{"citing_paper":"/paper/2412.01136"},"observation_digest":"sha256:5fbdda32f044828def59c4875869b47d077cb04cd27ba857a50e7e61a572e5ac","observation_id":"74a8702f-3397-492b-9705-167cb268bcbe","resolution":{"observed_at":"2026-08-12T04:42:30.801716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:42:30.777270Z","title":"A benchmark dataset and evaluation methodology for video object segmentation","venue":null,"work_id":"5f6c6701-dd42-4e03-b0b3-c470159b7038","year":2016},"citing_paper":{"arxiv_id":"2412.01136","last_updated":"2025-03-26T08:59:35Z","snapshot_observed_at":"2026-08-13T18:07:18.687056Z","submitted_at":"2024-12-02T05:20:35Z","title":"Referring Video Object Segmentation via Language-aligned Track Selection","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T04:42:30.309190Z"},"links":{"citing_paper":"/paper/2412.01136"},"observation_digest":"sha256:c7de00725762d0f2f8b37f7bb209c77c46b583b9964e90746df426a5b87db58b","observation_id":"6f332e0b-e8e8-422c-8616-623c1c5c75c7","resolution":{"observed_at":"2026-08-12T04:42:30.783350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-12T04:42:30.313812Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01136","last_updated":"2025-03-26T08:59:35Z","snapshot_observed_at":"2026-08-13T18:07:18.687056Z","submitted_at":"2024-12-02T05:20:35Z","title":"Referring Video Object Segmentation via Language-aligned Track Selection","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T04:42:30.313812Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2412.01136"},"observation_digest":"sha256:6201482382ca20bf8bceb717cbe25b2a4dc1883fceae054070c3c1dd0783864f","observation_id":"deaf41a7-9c1d-4c4d-90c4-d639b97bbee4","resolution":{"observed_at":"2026-08-12T04:42:30.313812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:42:30.758094Z","title":"Urvos: Unified referring video object segmentation network with a large-scale benchmark","venue":null,"work_id":"149c37af-91dd-4570-82f8-20543b419194","year":2020},"citing_paper":{"arxiv_id":"2412.01136","last_updated":"2025-03-26T08:59:35Z","snapshot_observed_at":"2026-08-13T18:07:18.687056Z","submitted_at":"2024-12-02T05:20:35Z","title":"Referring Video Object Segmentation via Language-aligned Track Selection","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T04:42:30.320392Z"},"links":{"citing_paper":"/paper/2412.01136"},"observation_digest":"sha256:dfe175e7adf66314dc55779847c40e5d13c65060235bc1bc27aa7543aebd3725","observation_id":"4a8dcfc2-c299-46a1-9f6d-86faa7caf827","resolution":{"observed_at":"2026-08-12T04:42:30.763510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:42:30.325968Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.01136","last_updated":"2025-03-26T08:59:35Z","snapshot_observed_at":"2026-08-13T18:07:18.687056Z","submitted_at":"2024-12-02T05:20:35Z","title":"Referring Video Object Segmentation via Language-aligned Track Selection","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T04:42:30.325968Z"},"links":{"citing_paper":"/paper/2412.01136"},"observation_digest":"sha256:c7a1229fa992041bfc30329b17dea28ca8da1ffc2cee361e4131c02058198330","observation_id":"1617197a-0fdd-4668-afc2-5ef4222d579f","resolution":{"observed_at":"2026-08-12T04:42:30.325968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:42:30.730544Z","title":"Data-efficient mul- timodal fusion on a single gpu","venue":null,"work_id":"75283d25-85c7-4857-9e67-2481b24788a8","year":2024},"citing_paper":{"arxiv_id":"2412.01136","last_updated":"2025-03-26T08:59:35Z","snapshot_observed_at":"2026-08-13T18:07:18.687056Z","submitted_at":"2024-12-02T05:20:35Z","title":"Referring Video Object Segmentation via Language-aligned Track Selection","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T04:42:30.330343Z"},"links":{"citing_paper":"/paper/2412.01136"},"observation_digest":"sha256:0555fe9dfe0029c05268023a5181f4be3bca5341ce2ee17a05a34fa168dab8c8","observation_id":"77670a91-7112-4f11-89a8-e3b7ef0d0497","resolution":{"observed_at":"2026-08-12T04:42:30.735719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:42:30.711362Z","title":"Language as queries for referring video object segmen- tation","venue":null,"work_id":"ed9342eb-447b-48e2-b75f-3bda5d011c98","year":2022},"citing_paper":{"arxiv_id":"2412.01136","last_updated":"2025-03-26T08:59:35Z","snapshot_observed_at":"2026-08-13T18:07:18.687056Z","submitted_at":"2024-12-02T05:20:35Z","title":"Referring Video Object Segmentation via Language-aligned Track Selection","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T04:42:30.336155Z"},"links":{"citing_paper":"/paper/2412.01136"},"observation_digest":"sha256:b29e15386612ddb6673e123fd5a74a2ce0baf65c50c23a7dea393ad9ffa9a7dd","observation_id":"4a000abf-1e12-427a-b2a3-5943585bfade","resolution":{"observed_at":"2026-08-12T04:42:30.719106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:42:30.688319Z","title":"Going right","venue":null,"work_id":"e23c63da-1f43-4139-b76e-a85a23a107fb","year":null},"citing_paper":{"arxiv_id":"2412.01136","last_updated":"2025-03-26T08:59:35Z","snapshot_observed_at":"2026-08-13T18:07:18.687056Z","submitted_at":"2024-12-02T05:20:35Z","title":"Referring Video Object Segmentation via Language-aligned Track Selection","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-12T04:42:30.341132Z"},"links":{"citing_paper":"/paper/2412.01136"},"observation_digest":"sha256:381c7d820a151c9baa99a4b0f0492aa5ad161181cfd8302bd66d390f03796edc","observation_id":"c50724b1-ee13-4332-949a-76b6a6232ef8","resolution":{"observed_at":"2026-08-12T04:42:30.695296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.01136","last_updated":"2025-03-26T08:59:35Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T18:07:18.687056Z","submitted_at":"2024-12-02T05:20:35Z","title":"Referring Video Object Segmentation via Language-aligned Track Selection"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":0,"verified_fuzzy":20},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 2 inbound Pith citation observations for arXiv:2412.01136."}