{"as_of":"2026-08-17T09:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a47242a6c6292d267043751aefa7886e0be61dc26753012cd9443cc17f7cc0e1","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T07:18:20.281383Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.12006/citation-record","integrity":"/paper/2605.12006/integrity","json":"/paper/2605.12006/citation-record.json","paper":"/paper/2605.12006"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.15385","last_updated":"2024-11-16T09:02:05Z","snapshot_observed_at":"2026-08-16T13:07:40.317972Z","submitted_at":"2024-10-20T13:00:24Z","title":"LoRA-IR: Taming Low-Rank Experts for Efficient All-in-One Image Restoration","version":2},"cited_work":{"arxiv_id":"2410.15385","doi":"10.48550/arxiv.2410.15385","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.15385","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Lora-ir: taming low-rank experts for efficient all-in-one image restoration","venue":"arXiv (Cornell University)","work_id":"178d14af-8a1d-4b46-a322-96fef973c807","year":2024},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-08-15T23:05:56.328531Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"cited_paper":"/paper/2410.15385","citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:95ae216772fb551c99311cd417b3e99164efd1714bf234ff06a31feb5bfdc065","observation_id":"c3b1e7ad-72f8-4f6a-ba13-3336b9a3781d","resolution":{"observed_at":"2026-05-13T07:22:29.347632Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Refereverything: Towards seg- menting everything we can speak of in videos","venue":null,"work_id":"00e7515d-1388-4aee-8724-9449bc027f0b","year":2025},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-08-15T23:05:56.328531Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:7e593581ed38103d8909694510ea3cc0aecb0f9e4c5682883a0a22565ef7b83a","observation_id":"f4ebf87a-d13b-4c55-a283-1cfd372bd42a","resolution":{"observed_at":"2026-05-13T08:32:32.178304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generalized foggy- scene semantic segmentation by frequency decoupling","venue":null,"work_id":"dc31a3aa-6414-4621-ba82-a40ad1b46457","year":2024},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-08-15T23:05:56.328531Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:5effc08ae5983875f84b16e5e080edc1e0503a8580baa9cd5231e53b58eae2e8","observation_id":"97fd307f-c211-4401-b9fb-42063a9eed85","resolution":{"observed_at":"2026-05-13T08:32:32.193435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"RobustSAM: segment anything robustly on de- graded images","venue":null,"work_id":"203ce409-37a0-4b1d-9d97-d236d4965e4f","year":2024},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-08-15T23:05:56.328531Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:37d95c2f0c098286d12acc9d5214a98f88b9047330c67ad4f2d4a55fbe405632","observation_id":"d2f1ee66-a7c2-4972-abeb-8a0901870e83","resolution":{"observed_at":"2026-05-13T08:32:32.166628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Putting the object back into video object segmentation","venue":null,"work_id":"bc8f7610-0a93-48c0-ad50-fea6c98d4f34","year":2024},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-08-15T23:05:56.328531Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:8552c45ea0cdc253881323179b1a8fa75ff4e93c1fc538bb494fe72a2b33dc03","observation_id":"b287e054-d22c-4b67-af3b-15338ca3c251","resolution":{"observed_at":"2026-05-13T08:32:32.170734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the effective- ness of layernorm tuning for continual learning in vision transformers","venue":null,"work_id":"b1325478-025a-4b59-9b15-edb0f3e5765c","year":2023},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-08-15T23:05:56.328531Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:baf3d9171a27bdd38efd6b990c164d68eadfb599023721dc95f79634c3afd0ba","observation_id":"06117325-b41c-4bc9-87f4-db16173a9225","resolution":{"observed_at":"2026-05-13T08:32:32.190266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MOSE: A new dataset for video object segmentation in complex scenes","venue":null,"work_id":"6e1551aa-cffd-49c8-a253-fbcdde07e5a5","year":2023},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-08-15T23:05:56.328531Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:5bf76af71fbdb6de793ecf0e7d925166993f91628e026b48daf95c8cd68b0bad","observation_id":"1dcc3bc4-9121-4e5f-b56b-5fa98da5c5eb","resolution":{"observed_at":"2026-05-13T08:32:32.174419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sam2long: Enhancing sam 2 for long video segmentation with a training-free memory tree","venue":null,"work_id":"056350e3-65a5-4687-9d54-0f1eb10268ba","year":2025},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-08-15T23:05:56.328531Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:9b23fa78aa31ef35bd1f859f0420eb45b52b9ef72112b754e320b14f1f471652","observation_id":"23e9dbd0-6f79-4c8a-8c75-49ff57c92a27","resolution":{"observed_at":"2026-05-13T08:32:32.186753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Switch transformers: Scaling to trillion parameter models with sim- ple and efficient sparsity.Journal of Machine Learning Re- search, 23(120):1–39","venue":null,"work_id":"77f19f15-4211-475f-817e-a52f81acaec4","year":2022},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-08-15T23:05:56.328531Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:bb43c96ae09bca18d687baab553754bcf8101a54fdce130374c7a8dad911c958","observation_id":"1bb27c12-6168-4b11-8a8a-ee9e7cb867e5","resolution":{"observed_at":"2026-05-13T08:32:32.182910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Devos: Flow-guided deformable trans- former for video object segmentation","venue":null,"work_id":"885b197e-9e01-45f3-9321-84345508db1b","year":2024},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-08-15T23:05:56.328531Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:baf242365ccc8a84faa623dc7215a6b733b07f33e6714c1290fb2b22de23b9cc","observation_id":"1c034f49-02d8-4579-8080-9973fd40a49f","resolution":{"observed_at":"2026-05-13T08:32:32.275053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vanishing-point-guided video semantic segmentation of driving scenes","venue":null,"work_id":"ba123bf6-7ae6-4ad1-8b2f-8c2838125ab1","year":2024},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-08-15T23:05:56.328531Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:c81723ff52a9b37ea31c61b075f4892949d6ba52793a5487e9c30e19f424f56c","observation_id":"ebf724fc-02f1-47da-b9a6-1755d2fb2e58","resolution":{"observed_at":"2026-05-13T08:32:32.201338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"X-prompt: Multi-modal visual prompt for video object segmentation","venue":null,"work_id":"535c8b5b-7469-448f-803a-73185ceec64a","year":2024},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-08-15T23:05:56.328531Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:8ee65438d48c5e49ea50ef6ba5af027ad06180cb8decaa27b48e90c31a1bfb92","observation_id":"83412c25-d660-4313-b939-d57e6ad666b7","resolution":{"observed_at":"2026-05-13T08:32:32.256384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Benchmarking neu- ral network robustness to common corruptions and perturba- tions","venue":null,"work_id":"85648d95-fdd6-49c6-87f5-281d69e0ac5e","year":2019},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-08-15T23:05:56.328531Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:81ab751eea9b2c889b3ab571dd605208db753a152a913e144a116ef9a35c5235","observation_id":"2fa3b0ce-8c20-4109-9c2f-3e4ef1182028","resolution":{"observed_at":"2026-05-13T08:32:32.296462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LoRA: Low-rank adaptation of large language models","venue":null,"work_id":"916feac6-e9e3-4f62-a8ac-7e41f1a3a0a3","year":2022},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-08-15T23:05:56.328531Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:92ed3e811242668cef5feffeac1ba7fa962786920885d4391df7d565dc22bfcc","observation_id":"8c8cbe77-76b5-492d-aa3e-d52858243567","resolution":{"observed_at":"2026-05-13T08:32:32.241075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Categorical repa- rameterization with gumbel-softmax","venue":null,"work_id":"a374caf9-37d3-47d0-975c-5fc728fa9e40","year":2017},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-08-15T23:05:56.328531Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:08c02edcd2edb5e5d3600e261895b7b48dca2e2d50a6fd94c04c87b2e461f57c","observation_id":"962a4751-31d9-45ec-807e-6f9eefd298ab","resolution":{"observed_at":"2026-05-13T08:32:32.227158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Yuille, and Li Cheng","venue":null,"work_id":"9042a617-de93-44a1-a01c-a8fb8c901f51","year":2023},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-08-15T23:05:56.328531Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:b300d0449f396556563bdc42c3da53d82a9f1c90a4dde801b200f8a492ed7aea","observation_id":"44022748-5d26-45bc-9b52-81281f78f708","resolution":{"observed_at":"2026-05-13T08:32:32.312393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Segment anything in high quality","venue":null,"work_id":"f19ff36c-c130-498a-964e-d5d755379f3f","year":2023},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-08-15T23:05:56.328531Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:95908a4c0cf94f0869beff91475aa227298f22c286c440ca4c6c9ffbbba7be0f","observation_id":"4be7473d-96cf-4b02-ad9f-3b6e3021bee1","resolution":{"observed_at":"2026-05-13T08:32:32.230365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Event-guided deblurring of unknown exposure time videos","venue":null,"work_id":"d6a0b766-6aa4-49ab-afe4-8734fa0fe40a","year":null},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-08-15T23:05:56.328531Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:9a23be3040a436bee0306ceed3b1d067a973828b1f42589e8fd46491a65dfadd","observation_id":"d7098849-95ac-4195-b374-2429b0265f87","resolution":{"observed_at":"2026-05-13T08:32:32.249482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ex- ploring temporally dynamic data augmentation for video recognition","venue":null,"work_id":"c7dcf4c0-ed1b-4ed6-8574-f562e8f2534e","year":2023},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-08-15T23:05:56.328531Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:c7884bca03c9fd46e5b27d6d3423bdde62dea65ebae41029e48f8d81d72adcb1","observation_id":"837bcd43-7f7a-43e5-830b-0e557ddd8e17","resolution":{"observed_at":"2026-05-13T08:32:32.315980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Segment any- thing","venue":null,"work_id":"8d004aa5-f6fb-4ad2-a519-f9574d93e2a5","year":2023},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-08-15T23:05:56.328531Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:6c200a4506fe5d6b952b66dff0ff7967f964658de19e42d0389e2584eb96fa87","observation_id":"0c95e41a-45d5-4a1d-a38a-11cbf2fab0d1","resolution":{"observed_at":"2026-05-13T08:32:32.219976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fifo: Learn- ing fog-invariant features for foggy scene segmentation","venue":null,"work_id":"ce109be2-232a-4255-8662-e429c529de38","year":2022},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-08-15T23:05:56.328531Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:c25812a6c993591f3947b8293926bf61eb3ddfb48ecf15b291d12353bbdac1a2","observation_id":"e409864e-759a-47bc-9d84-999a3e50a117","resolution":{"observed_at":"2026-05-13T08:32:32.259787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Human pose estimation in extremely low-light con- ditions","venue":null,"work_id":"841bf8c7-eb6b-4897-9905-a56feaa14650","year":2023},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-08-15T23:05:56.328531Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:3195737a655b139e37ab153cb8f0d34fd1364c2b821b279464a6ea6e0b826a59","observation_id":"21bbcc0c-3cbe-4933-8f93-d54e93c6a398","resolution":{"observed_at":"2026-05-13T08:32:32.306058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Frest: Feature restoration for semantic segmentation under multiple adverse conditions","venue":null,"work_id":"5a68ff40-70d0-4880-a24c-0cadb87c71e9","year":2024},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-08-15T23:05:56.328531Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:5879ca83bc6ff14046fbce685587cbd0225f6e708134da11e8993d6456d1ecad","observation_id":"4088cf77-ebe0-4a8c-a9d7-7a811ea42d28","resolution":{"observed_at":"2026-05-13T08:32:32.272704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GaRA-SAM: Robustifying segment anything model with gated-rank adaptation","venue":null,"work_id":"f064b7a3-17e3-48a4-be46-d2aaacb78708","year":2025},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-08-15T23:05:56.328531Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:f61e6216bc3dad375fe35bad29340cd973b235d6a5b1c2d88e1fa61c1d3ae37f","observation_id":"05750ca0-c7bc-45fa-b798-f7f11a53c078","resolution":{"observed_at":"2026-05-13T08:32:32.293056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04981","last_updated":"2025-06-03T13:37:22Z","snapshot_observed_at":"2026-08-16T12:43:24.042018Z","submitted_at":"2025-04-07T12:09:18Z","title":"TestDG: Test-time Domain Generalization for Continual Test-time Adaptation","version":2},"cited_work":{"arxiv_id":"2504.04981","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.04981","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Testdg: Test-time domain general- ization for continual test-time adaptation","venue":null,"work_id":"4c0af44b-4f96-47cc-b899-6b71b18fbb7b","year":2025},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-08-15T23:05:56.328531Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"cited_paper":"/paper/2504.04981","citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:008f47b1ebcc0e6eaccd12dfb7540b054126bbabaa47096c2b30e781e217fbba","observation_id":"471b77c6-55f6-48a5-8691-7bd43d998ae7","resolution":{"observed_at":"2026-05-13T07:22:29.363471Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"All-In-One Image Restoration for Unknown Corruption","venue":null,"work_id":"133e81ae-0417-4368-9160-40f871436aec","year":2022},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-08-15T23:05:56.328531Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:eaf180fdb8a0782b7825e5de6bfc83dd8744471ce8663f0f3697dd03bbc91cac","observation_id":"d0aa955b-06af-4929-b469-1fe2d7b79ee4","resolution":{"observed_at":"2026-05-13T08:32:32.223781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Event-assisted low-light video object segmentation","venue":null,"work_id":"0320962e-6ad2-4a4a-b71e-62af2370fb10","year":2024},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-08-15T23:05:56.328531Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:ffefc5bc71c3a0c0cea6c4796fb095b6fbf604c8869cc9a75c05d951feb314a9","observation_id":"5a2001cb-f722-43b0-bc12-c9722e7e7177","resolution":{"observed_at":"2026-05-13T08:32:32.212872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"UniVS: Unified and universal video segmentation with prompts as queries","venue":null,"work_id":"380f632f-5aec-4923-8186-858c4b037f19","year":2024},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-08-15T23:05:56.328531Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:431142c1b321261588bb4f0ed5e9feb30eff46eb99df6832c56c353640139cc4","observation_id":"924f8546-8ea6-4c73-aed5-0cfd60ef8d37","resolution":{"observed_at":"2026-05-13T08:32:32.302613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning spatial-semantic fea- tures for robust video object segmentation","venue":null,"work_id":"d7d70ee3-7128-4203-adc9-f45a4dd9edb7","year":null},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-08-15T23:05:56.328531Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:a8b02582fd7edd2ef8b9ed4a33cd96ff07c6e6fe1f515f2675f0d2efa6e9fd4d","observation_id":"451bdd40-eefa-4754-8869-a89238548cf0","resolution":{"observed_at":"2026-05-13T08:32:32.269703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unified open-world segmentation with multi-modal prompts","venue":null,"work_id":"a37cdc9e-4b1f-4a5f-89ef-f2aa0bf862f2","year":2025},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-08-15T23:05:56.328531Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:6334df2b1a7850727d83bfe521d62875481c2142d3b7596a511f1459e5f59d13","observation_id":"0744971c-7515-4555-9881-db282eb71e2d","resolution":{"observed_at":"2026-05-13T08:32:32.216032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Decoupled weight decay regularization","venue":null,"work_id":"409fa2f6-d745-4dd8-85f1-4b7f5ca77bb8","year":2019},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-08-15T23:05:56.328531Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:1c5aca40bd6ec16ab0606347d65d55cceb85dcef9f7b0f6d04a36b52f0cdda75","observation_id":"5385a13a-e530-474b-8423-3e392c2ea89b","resolution":{"observed_at":"2026-05-13T08:32:32.299395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Image segmenta- tion using text and image prompts","venue":null,"work_id":"ed3adb89-7dc9-4892-923e-e3193738656e","year":2022},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-08-15T23:05:56.328531Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:b48f445ca92282925699ef1241e42a2197859defc707b4ef1d5243f7342ac4ff","observation_id":"9822aab2-f841-4052-a37c-73dd505f0606","resolution":{"observed_at":"2026-05-13T08:32:32.237266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sam- i2v: Upgrading sam to support promptable video segmen- tation with less than 0.2% training cost","venue":null,"work_id":"bda4ee03-7535-4a00-aebf-8a633425fb90","year":2025},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-08-15T23:05:56.328531Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:d9beff99691c2d4966bd42586cbadeb86f4c75f1d3cbe84050e44976f33d3513","observation_id":"4150c7e0-2e51-4534-b694-4cdcb139d2ca","resolution":{"observed_at":"2026-05-13T08:32:32.233382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A benchmark dataset and evaluation methodology for video object segmentation","venue":null,"work_id":"3a54c5a9-32b5-4d05-962b-1a61fe09186b","year":2016},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-08-15T23:05:56.328531Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:ccee20e19b006bf187af7bbeda16afb3d6c6a3d50bf386f4ed053d7c522ecb5d","observation_id":"e6d52516-e1ad-4670-8666-305bf7e977f3","resolution":{"observed_at":"2026-05-13T08:32:32.279515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"PromptIR: Prompting for all-in-one image restoration","venue":null,"work_id":"0b88a567-a33e-4ffa-92ea-9b25e223d7c7","year":2023},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-08-15T23:05:56.328531Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:1f3b044da0463524e03e79142f1a1c8e0b403661f7a904ccce30a2a6fb1e18ed","observation_id":"08267615-6cc6-4a1b-89df-48b67561175a","resolution":{"observed_at":"2026-05-13T08:32:32.205304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.08682","last_updated":"2022-12-09T14:53:21Z","snapshot_observed_at":"2026-08-16T16:15:48.430367Z","submitted_at":"2022-11-16T05:31:49Z","title":"Parameter-Efficient Tuning on Layer Normalization for Pre-trained Language Models","version":3},"cited_work":{"arxiv_id":"2211.08682","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.08682","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Parameter-efficient tuning on layer normalization for pre- trained language models.arXiv preprint arXiv:2211.08682","venue":null,"work_id":"749e678b-1b29-48ed-865b-5b0e884a39c0","year":2022},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-08-15T23:05:56.328531Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"cited_paper":"/paper/2211.08682","citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:a02746259db08fc9fdbbe90da63e52493b711a6d4423f30ae399e36d2e1ce40d","observation_id":"ed97106a-f7cc-4c1b-983c-347f2da12998","resolution":{"observed_at":"2026-05-13T07:22:29.378488Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SAM 2: Segment anything in images and videos","venue":null,"work_id":"1c453fb8-2aad-4d66-a324-6e23ecbbe1c6","year":2025},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-08-15T23:05:56.328531Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:63fb91b7580d575d37c9001656b71d179ba81f12427cecbba71f522c99a8567d","observation_id":"5339354b-47ab-4f7c-83cc-0600e851451b","resolution":{"observed_at":"2026-05-13T08:32:32.285160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ACDC: The adverse conditions dataset with correspondences for se- mantic driving scene understanding","venue":null,"work_id":"2a125e18-3a31-4b4e-82a9-c341f377aa13","year":2021},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-08-15T23:05:56.328531Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:afd9a6b18ebfdeb51985ca88a62038830333eca43307d8f88dba51ec29a8cd06","observation_id":"97a45742-1061-49bb-b54f-fc154599dd0c","resolution":{"observed_at":"2026-05-13T08:32:32.262738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ACDC: The adverse condi- tions dataset with correspondences for robust semantic driv- ing scene perception.IEEE Transactions on Pattern Analysis and Machine Intelligence","venue":null,"work_id":"2c6e8ecf-9ab8-4ecb-a22a-e5952dc1ebce","year":2025},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-08-15T23:05:56.328531Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:8096b54ee7066c5447cbf52ffc0ecc91ae59020b33c0d750fa2151f97fdf7b02","observation_id":"c28ce58f-0d40-4dea-ae9e-8ff25441644e","resolution":{"observed_at":"2026-05-13T08:32:32.253479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kernelized memory network for video object segmentation","venue":null,"work_id":"ead3544e-d35b-4484-97d3-5520a1a542e0","year":2020},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-08-15T23:05:56.328531Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:bcbd886bd7de1c05c2efbdae128703e535ecefdfc7ce0b0612a7881217bf50d6","observation_id":"168e561f-9b6e-4c09-9b20-77cbaccfcbcc","resolution":{"observed_at":"2026-05-13T08:32:32.277389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Urie: Universal image enhancement for visual recognition in the wild","venue":null,"work_id":"2fc5a354-6ae1-47d2-a909-fc99ab2e9458","year":2020},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-08-15T23:05:56.328531Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:2ebc8496a058964d2c610844b178f22492f27ce9c9ced1c53f0c2cfd9b5ff5bf","observation_id":"b34773af-bc6d-4d2a-82a5-92cec3dacc4f","resolution":{"observed_at":"2026-05-13T08:32:32.266686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning video object segmentation with visual memory","venue":null,"work_id":"6fc19268-4134-4cad-973d-5cdcedff7e13","year":2017},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-08-15T23:05:56.328531Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:3a94164d36c58d0c8ca19973a359efd49134fd884b33ff1ad596db7af0fbb0a4","observation_id":"a9e602ac-e6d7-4235-80ae-810836643ed3","resolution":{"observed_at":"2026-05-13T08:32:32.245063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning motion patterns in videos","venue":null,"work_id":"3d5f4a2e-aa66-4bb2-a930-5a0cfd683999","year":2017},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-08-15T23:05:56.328531Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:3b67a876d7fa23e24ce05fe0091bbc4085623d1959acf3922f55ad441e0300a3","observation_id":"f8d0548f-5e56-4ad1-8cdc-826104cefa6e","resolution":{"observed_at":"2026-05-13T08:32:32.288936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video segmentation via object flow","venue":null,"work_id":"87aee393-f792-4f5f-aa0b-55255583034e","year":2016},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-08-15T23:05:56.328531Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:3bd6dc33c86b6da30fbd3593a9449c81d66a0a9a7040379496e7a21cb6fee9d6","observation_id":"374b87df-cc1a-40bf-b26c-6401fde53bc8","resolution":{"observed_at":"2026-05-13T08:32:32.208743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20284","last_updated":"2024-03-29T16:53:11Z","snapshot_observed_at":"2026-08-16T14:05:09.348170Z","submitted_at":"2024-03-29T16:53:11Z","title":"LayerNorm: A key component in parameter-efficient fine-tuning","version":1},"cited_work":{"arxiv_id":"2403.20284","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.20284","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Layernorm: A key component in parameter-efficient fine-tuning","venue":null,"work_id":"a00c6a11-e3cc-4aef-8106-b624405f3c6d","year":2024},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-08-15T23:05:56.328531Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"cited_paper":"/paper/2403.20284","citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:bfbd4109f7a8f3047a8a5257ca198f87bf6ba292260ab8668e977fb3b45607e3","observation_id":"eebc040e-517a-4396-af86-b7d6380f7f0a","resolution":{"observed_at":"2026-05-13T07:22:29.384386Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient track anything","venue":null,"work_id":"cb382d98-92bb-4ddc-b122-c93ab25500bf","year":2025},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-08-15T23:05:56.328531Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:1842ba7c0568b300a6c1b37b5a9e10e53ee93b34c2a602c8ecac21a32f15a43f","observation_id":"5386cf7c-0861-4054-bdd7-a2bf35d6a36b","resolution":{"observed_at":"2026-05-13T08:32:32.281975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.03327","last_updated":"2018-09-06T04:19:45Z","snapshot_observed_at":"2026-08-14T18:32:23.594089Z","submitted_at":"2018-09-06T04:19:45Z","title":"YouTube-VOS: A Large-Scale Video Object Segmentation Benchmark","version":1},"cited_work":{"arxiv_id":"1809.03327","doi":null,"metadata_source":"pith","pith_arxiv_id":"1809.03327","snapshot_observed_at":"2026-07-08T02:04:26.310872Z","title":"YouTube-VOS: A Large-Scale Video Object Segmentation Benchmark","venue":"cs.CV","work_id":"2798c43d-6f6c-445b-8a43-14cba092aa4b","year":2018},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-08-15T23:05:56.328531Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"cited_paper":"/paper/1809.03327","citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:c2623d010bdf53b529db3b2d0d713d44088a4c0f58f3fe5c24b76f329dd90eb1","observation_id":"73302bf2-b071-4a48-9048-9338e3dbac4c","resolution":{"observed_at":"2026-05-13T07:22:29.355364Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11420","last_updated":"2023-12-18T18:21:43Z","snapshot_observed_at":"2026-08-16T14:33:40.451825Z","submitted_at":"2023-12-18T18:21:43Z","title":"Tuning LayerNorm in Attention: Towards Efficient Multi-Modal LLM Finetuning","version":1},"cited_work":{"arxiv_id":"2312.11420","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.11420","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tuning layernorm in attention: Towards efficient multi-modal llm finetuning","venue":null,"work_id":"7923c4a9-522a-4c50-88a7-01ace4da7b23","year":2023},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-08-15T23:05:56.328531Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"cited_paper":"/paper/2312.11420","citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:fa8f26a9035639c69230cf170c602efdef547c8a16ed4bb147ef8ae81f603d5f","observation_id":"85c87951-1c27-4c23-a30a-974909a0c7dc","resolution":{"observed_at":"2026-05-13T07:22:29.372361Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rmem: Re- stricted memory banks improve video object segmentation","venue":null,"work_id":"44a9ff99-4e5b-4e60-93cc-4fd82221394f","year":2024},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-08-15T23:05:56.328531Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:fbbc7c8dfebf1dd242f638d4ab3cdc62eec170ea141410c14249a8b9e9c1dbd4","observation_id":"8bc5faea-0b56-4967-b548-58eb5614df2a","resolution":{"observed_at":"2026-05-13T08:32:32.197118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Segment everything everywhere all at once","venue":null,"work_id":"00f291bb-15e4-420e-8029-f058c7e78716","year":2023},"citing_paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","snapshot_observed_at":"2026-08-15T23:05:56.328531Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-13T07:18:20.281383Z"},"links":{"citing_paper":"/paper/2605.12006"},"observation_digest":"sha256:32d136017a619d9d873404ea7659e7ae07c938ca9e41d00a1ed89b55df365416","observation_id":"cc76d622-ce00-4126-a9fb-6290cb500c91","resolution":{"observed_at":"2026-05-13T08:32:32.309365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.12006","last_updated":"2026-05-12T11:55:31Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T23:05:56.328531Z","submitted_at":"2026-05-12T11:55:31Z","title":"Robust Promptable Video Object Segmentation"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":6,"verified_fuzzy":44},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 0 inbound Pith citation observations for arXiv:2605.12006."}