{"as_of":"2026-08-10T12:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b3a7c4ded092aa6c4d12916848cf3bce9b265bed81d437b725c46cb35f9512ba","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T10:16:59.222616Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.09660/citation-record","integrity":"/paper/2502.09660/integrity","json":"/paper/2502.09660/citation-record.json","paper":"/paper/2502.09660"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-08T10:16:59.004858Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-09T17:03:33.790317Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.004858Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:af2124027681b9c9c2f04ae8da5c6dc5ce2c4aed9c3dd5dbb8ff7fcffd6230e8","observation_id":"a58a2399-cda4-460f-8930-ab44c02f8baa","resolution":{"observed_at":"2026-08-08T10:16:59.004858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.920784Z","title":"Per-pixel classification is not all you need for semantic segmentation","venue":null,"work_id":"f0689772-79f3-4e3b-9e4b-29b7906a4820","year":2021},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-09T17:03:33.790317Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.011031Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:9c93c1374fe6f8359498666f93f92ea9c4fc5b6eb742bff0e782f92150a02a4f","observation_id":"a32f7675-49bf-48ea-be49-2505cefe187c","resolution":{"observed_at":"2026-08-08T10:16:59.925798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.905954Z","title":null,"venue":null,"work_id":"b4db7ddd-e9e3-4efc-994a-654deb4d1e4d","year":2022},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-09T17:03:33.790317Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.015816Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:564ab38685760d7c364cb900eef2e4b3db3bf5197a5e892bed8fdaf4c7ac15c8","observation_id":"479e092a-5c98-4226-8cfd-dd0ed8a65117","resolution":{"observed_at":"2026-08-08T10:16:59.910485Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.891154Z","title":"Xmem: Long- term video object segmentation with an atkinson-shiffrin memory model","venue":null,"work_id":"21728906-b519-4dcc-8684-5f0e891cdaea","year":2022},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-09T17:03:33.790317Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.020807Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:2d41ca1c9bba067be76fce753aa17cd099511fba829f1d6fc0a5a91a597fb7b5","observation_id":"a625fdcf-24ad-4887-bb94-c726b31caa18","resolution":{"observed_at":"2026-08-08T10:16:59.895999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.875979Z","title":"CascadePSP: Toward class-agnostic and very high- resolution segmentation via global and local refinement","venue":null,"work_id":"48acec1a-18b0-4059-925f-4f0d5b446bed","year":2020},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-09T17:03:33.790317Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.026480Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:6257c24db9a9c46b1535ba938ecda7934c834cd698e4d2c41d001d2d127c1146","observation_id":"adb37cc1-5c12-426d-bb54-06384bcec244","resolution":{"observed_at":"2026-08-08T10:16:59.880723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.860747Z","title":"Schwing Alexander Kirillov Cheng, Bowen and Rohit Girdhar","venue":null,"work_id":"eb94a67b-9fcd-4204-b3d0-0c33320c2670","year":2022},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-09T17:03:33.790317Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.031079Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:5cd4dfeab537de22d4b4ab0ed20af62536949967d60cb6403e5833ca6840707f","observation_id":"3f19c9e9-6c00-4062-80e5-17221714b97f","resolution":{"observed_at":"2026-08-08T10:16:59.865618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.845548Z","title":"Collins Yukun Zhu Ting Liu Thomas S","venue":null,"work_id":"e0bbc423-3209-4c37-8692-288a206bf297","year":2020},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-09T17:03:33.790317Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.036295Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:bcbbe66e34e306f42fcb0499d349110f12a74df4239dbaa8140e0f58c218cde9","observation_id":"b06ef80c-a69a-4be5-99fd-6b1720d52cb6","resolution":{"observed_at":"2026-08-08T10:16:59.850402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.829638Z","title":"Global contrast based salient region detection","venue":null,"work_id":"a2ef46b4-77d9-4502-993c-4fb7b624c280","year":2014},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-09T17:03:33.790317Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.040899Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:cd6ab9c31bfc0f571f4166c16f42aa63eff69276d3efc9e0421ff08cdf1bc076","observation_id":"ba736375-d047-4514-8f61-c7b85c935669","resolution":{"observed_at":"2026-08-08T10:16:59.835145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.814197Z","title":"Instance-aware se- mantic segmentation via multi-task network cascades","venue":null,"work_id":"fadd9096-de05-4f10-8df8-f54d0cd8a587","year":2016},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-09T17:03:33.790317Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.045465Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:4c78e6421f30c0de4f0f1da034c67fb1895b151b68f2445a0a5e31081e59e770","observation_id":"c15364fd-d8ac-4ca6-b1a1-ec9db101a14a","resolution":{"observed_at":"2026-08-08T10:16:59.818916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.799692Z","title":"Seg- ment and recognize anything at any granularity","venue":null,"work_id":"18272e70-3c79-4884-8756-d3040b2b76d2","year":2024},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-09T17:03:33.790317Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.050169Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:061cc0b9de29aa816dfe9f69831c8b72796117e6e79c8cb0208c9e48b319b73e","observation_id":"93fd1ef5-0eb8-4c9c-8f4e-020db3ba7ea7","resolution":{"observed_at":"2026-08-08T10:16:59.804294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.784797Z","title":"Lvis: A dataset for large vocabulary instance segmentation","venue":null,"work_id":"e16b7b0a-bdbf-4b2b-abb1-ee5a1addf7f5","year":2019},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-09T17:03:33.790317Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.054725Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:e8d15b398b072e186797888ba044aa34593da50642760f0de65661ca18684385","observation_id":"ac2f5d83-0580-4c95-bcba-1d30d6345cb8","resolution":{"observed_at":"2026-08-08T10:16:59.789685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.769770Z","title":"Mask r-cnn","venue":null,"work_id":"8e5734e5-8eb5-4b4a-9188-8f4b9f5f285b","year":2017},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-09T17:03:33.790317Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.059374Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:9c087050399cb80967cf8790fb7f5ba3740e2e6725e19a156972f3dee48781e3","observation_id":"c9a2b46c-ac18-4f16-be57-d06b8df508c0","resolution":{"observed_at":"2026-08-08T10:16:59.774429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.754417Z","title":"Rethink- ing space-time networks with improved memory coverage for efficient video object segmentation","venue":null,"work_id":"6cadb7de-08a6-4b4f-bdcb-ce4f42ee4eb6","year":2021},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-09T17:03:33.790317Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.064060Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:8ebe630cf49fdeeb6e5b8a0838ef50bf9b1ee06fe0ff98a35174950b748a31f8","observation_id":"61314d26-c4e3-4a5e-aa07-745b5392b1a8","resolution":{"observed_at":"2026-08-08T10:16:59.759442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.068505Z","title":"Panoptic segmentation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-09T17:03:33.790317Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.068505Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:c9024b3a7d7d6bc1bc32f4f4f4126a79433fa9d4327e06bfa38a8f696863dc75","observation_id":"b070dc0d-5c1c-457b-b0dd-f8c707ef5a53","resolution":{"observed_at":"2026-08-08T10:16:59.068505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.727658Z","title":"Berg, Wan-Yen Lo, Piotr Dollár, and Ross Girshick","venue":null,"work_id":"33432ed9-cf05-4dde-9599-fe947147a6ee","year":2023},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-09T17:03:33.790317Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.072930Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:2e0b62c70c360eb22917a3e9a9a74790469759893455d8de4fb29626960f97a4","observation_id":"db586eca-b7aa-4a30-aa0a-cc4ae127b4c0","resolution":{"observed_at":"2026-08-08T10:16:59.732802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.711307Z","title":"Segment anything in high quality","venue":null,"work_id":"98d15a95-7dbd-451c-b745-de706eb5ead1","year":2023},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-09T17:03:33.790317Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.077306Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:82341f327bc98a44d169791964cffa42ec41e202c20b7b01c442263732ace2c0","observation_id":"06cac80c-b8d1-406c-bd1e-5288f5bdf872","resolution":{"observed_at":"2026-08-08T10:16:59.716343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.696026Z","title":"Fss-1000: A 1000-class dataset for few- shot segmentation","venue":null,"work_id":"28ecbb34-1433-46d5-92d3-7a9d59c80aff","year":2020},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-09T17:03:33.790317Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.081856Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:0d6a17cc245467a3ed26f0d2a0db321bd13bc5aefd57f87969ed40f8157e0d1f","observation_id":"8b8f689c-b8ff-418f-80d9-c93fb077ae00","resolution":{"observed_at":"2026-08-08T10:16:59.700899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.05587","last_updated":"2017-12-05T18:06:21Z","snapshot_observed_at":"2026-08-07T13:44:53.690521Z","submitted_at":"2017-06-17T22:48:57Z","title":"Rethinking Atrous Convolution for Semantic Image Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.05587","snapshot_observed_at":"2026-08-08T10:16:59.086439Z","title":"Rethinking atrous convolution for semantic image segmentation","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-09T17:03:33.790317Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.086439Z"},"links":{"cited_paper":"/paper/1706.05587","citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:9edd33b0c7fa6e3d3b39f4aa52dae8b12b1f7d4a3f74a37646ef5bdae2da0bb4","observation_id":"ab11bf46-4feb-424b-ab11-cf251444ca2a","resolution":{"observed_at":"2026-08-08T10:16:59.086439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.681025Z","title":"Deep interactive thin object selection","venue":null,"work_id":"91d6311b-5cfc-4ff3-84a2-be1c24b9aa88","year":2021},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-09T17:03:33.790317Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.091150Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:0ed8118cd96079be0c6eeac0dcad885964c53dae3471a70cda5e26a35fbb9272","observation_id":"1fc20d64-650b-41e2-8345-aacb4f51dd24","resolution":{"observed_at":"2026-08-08T10:16:59.685948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.665930Z","title":"Segment anything with precise interaction","venue":null,"work_id":"53bcf11f-3ce5-4412-a1e7-3d2a6174245f","year":2024},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-09T17:03:33.790317Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.095546Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:692532573de14b48ff8faacef991584b6ca201c85e2cb6ef0fc3398e74200eff","observation_id":"00698961-8a1a-4e75-a6df-83c232d9dffc","resolution":{"observed_at":"2026-08-08T10:16:59.670729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.652006Z","title":"Receptive field block net for accurate and fast object detection","venue":null,"work_id":"12bf287e-a156-49b1-a4bd-df307a127e94","year":2018},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-09T17:03:33.790317Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.100231Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:db38fbaeda6148c619a7f203291bafd2f3e89cf3d2ae2b3d046e0324e7e48b5f","observation_id":"5966737f-cbd8-4baa-85fe-98736c4cf77c","resolution":{"observed_at":"2026-08-08T10:16:59.656542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.104585Z","title":"Fully convolutional networks for semantic segmentation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-09T17:03:33.790317Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.104585Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:f5f7d56f54bd05eea280b72a07b775d7c5441e31de089e4887b94930198cebdc","observation_id":"771023ec-81f7-416c-9b1e-e877d8f5d5ae","resolution":{"observed_at":"2026-08-08T10:16:59.104585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.108941Z","title":"Segment anything in medical images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-09T17:03:33.790317Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.108941Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:95dc94eb5d77b5a30f83ab162b12ececff8553ce58fb0e667a97574ea7e3e7c8","observation_id":"526b13bf-2f70-4049-85f6-b2cdbcfd32dd","resolution":{"observed_at":"2026-08-08T10:16:59.108941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.617521Z","title":"Gaus- sian grouping: Segment and edit anything in 3d scenes","venue":null,"work_id":"0ff100b9-1a9f-4249-a623-e58e7603fd90","year":2024},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-09T17:03:33.790317Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.114203Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:43f48a1f91dc287346f6df5ade88e664674a784aae9ddd546d3c1bab19f3eb25","observation_id":"6b3d4c92-06d6-4026-a5af-7ec1215da5b2","resolution":{"observed_at":"2026-08-08T10:16:59.622584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.603082Z","title":"Recurrent dynamic embedding for video object segmentation","venue":null,"work_id":"14c41579-6d5a-4a99-a36d-a30de329f89e","year":2022},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-09T17:03:33.790317Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.118776Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:ed9e30fb200f7f276182dc260163812a7a5ce06139a3def8b2d2e33e16f66d78","observation_id":"a4f6d3b3-7b04-42d4-8717-f1056b123f0d","resolution":{"observed_at":"2026-08-08T10:16:59.607832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.588675Z","title":"Highly accurate dichotomous im- age segmentation","venue":null,"work_id":"b8e64362-10e9-45b4-b499-76222d1bad6e","year":2022},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-09T17:03:33.790317Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.123407Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:a24bde9dbe3ab962885b9a72eed77eb42bc1785a23157bd900550c621997c15a","observation_id":"3ac1ec4e-2c44-4da4-a3bb-fdfb5bd69fab","resolution":{"observed_at":"2026-08-08T10:16:59.593340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.574082Z","title":"Learning dynamic convolutions for multi-modal 3d mri brain tumor segmentation","venue":null,"work_id":"42582dee-bba4-47d8-aea2-5ef3d214b264","year":2020},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-09T17:03:33.790317Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.127847Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:b26c250e81e650cb5cc00ceee92f3294c82302c8e458215dc0491f1952e78135","observation_id":"ed8a5d5c-db66-4091-b9d5-091e8221d5ca","resolution":{"observed_at":"2026-08-08T10:16:59.578848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-08T10:16:59.138379Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-09T17:03:33.790317Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.138379Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:096acf28d6ab075176c6f8ffe46f16263c1409ea06cac882f75351b886e7322a","observation_id":"1d187f0e-dc79-4dd0-ae4c-85d26ac450b4","resolution":{"observed_at":"2026-08-08T10:16:59.138379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.559108Z","title":"Hi- era: A hierarchical vision transformer without the bells-and- whistles","venue":null,"work_id":"7cf2ba72-4b02-4b76-b9b4-dd8fae379a83","year":2023},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-09T17:03:33.790317Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.143696Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:c5d55bb2fe04d0721b5d8007e7bc680beb0b8856bbc2da09f8f3c5df1c4da5e0","observation_id":"2f5e8bd8-699d-4adf-82ef-911d9c0c9c7e","resolution":{"observed_at":"2026-08-08T10:16:59.563735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10261","last_updated":"2023-04-19T16:39:51Z","snapshot_observed_at":"2026-08-04T21:24:21.644542Z","submitted_at":"2023-04-19T16:39:51Z","title":"Anything-3D: Towards Single-view Anything Reconstruction in the Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10261","snapshot_observed_at":"2026-08-08T10:16:59.148568Z","title":"Anything- 3d: Towards single-view anything reconstruction in the wild","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-09T17:03:33.790317Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.148568Z"},"links":{"cited_paper":"/paper/2304.10261","citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:67b6b38a581df86c284748ae4754fc13fb5f4a06b50da5d0b293febd96317c5d","observation_id":"2963cc28-4e65-4378-a6b6-74a539a72178","resolution":{"observed_at":"2026-08-08T10:16:59.148568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.544639Z","title":"Hierarchical image saliency detection on extended cssd","venue":null,"work_id":"22d7c0ac-0bf3-4048-bfec-5d716cdae71c","year":2015},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-09T17:03:33.790317Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.153510Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:0de687ef51fc08f7d8ba37cc32b8262da7c9198f57d0ba7d3787233260a72f35","observation_id":"ed74f668-cf70-4714-ae81-2497ed6c1b72","resolution":{"observed_at":"2026-08-08T10:16:59.549339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12425","last_updated":"2023-12-19T18:53:47Z","snapshot_observed_at":"2026-08-10T02:51:32.191904Z","submitted_at":"2023-12-19T18:53:47Z","title":"SegRefiner: Towards Model-Agnostic Segmentation Refinement with Discrete Diffusion Process","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.12425","snapshot_observed_at":"2026-08-08T10:16:59.157871Z","title":"Segrefiner: Towards model- agnostic segmentation refinement with discrete diffusion process","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-09T17:03:33.790317Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.157871Z"},"links":{"cited_paper":"/paper/2312.12425","citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:80199d2ecce82df8d09d2c97ae7c5713b58941a0ece325810d037eb20f9e59cc","observation_id":"5bcc1b51-d77b-499c-9c2a-b56182ce3621","resolution":{"observed_at":"2026-08-08T10:16:59.157871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.530234Z","title":null,"venue":null,"work_id":"661d7f9d-cf13-422a-b4bc-3eeeceafd077","year":2020},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-09T17:03:33.790317Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.162792Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:cb749a53d58a21a6741264b42f1e54aa528696994955b4884e14a9173897226e","observation_id":"c8612123-b0b0-4c49-bc43-b6e8a3bdb295","resolution":{"observed_at":"2026-08-08T10:16:59.534776Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03284","last_updated":"2023-04-06T17:59:57Z","snapshot_observed_at":"2026-08-09T03:50:44.384164Z","submitted_at":"2023-04-06T17:59:57Z","title":"SegGPT: Segmenting Everything In Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03284","snapshot_observed_at":"2026-08-08T10:16:59.167280Z","title":"Seggpt: Segmenting ev- erything in context","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-09T17:03:33.790317Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.167280Z"},"links":{"cited_paper":"/paper/2304.03284","citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:4e4d44dd75bd31c1482921c731dffa5a3bcd03a6aa2ff3f16ed4fb88dd9585ff","observation_id":"064aadbb-d1fc-4fa6-bfa5-c65e6f5c8159","resolution":{"observed_at":"2026-08-08T10:16:59.167280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.12620","last_updated":"2023-12-29T03:40:59Z","snapshot_observed_at":"2026-07-06T15:19:39.223171Z","submitted_at":"2023-04-25T07:34:22Z","title":"Medical SAM Adapter: Adapting Segment Anything Model for Medical Image Segmentation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.12620","snapshot_observed_at":"2026-08-08T10:16:59.172197Z","title":"Medical sam adapter: Adapting seg- ment anything model for medical image segmentation.arXiv preprint arXiv:2304.12620, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-09T17:03:33.790317Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.172197Z"},"links":{"cited_paper":"/paper/2304.12620","citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:90cef08dd215f57e3224df0a46c9aa22d4ee4f9f037c946695b9447e69b45fed","observation_id":"df79e754-b358-4446-9f10-6f867a677fa7","resolution":{"observed_at":"2026-08-08T10:16:59.172197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14006","last_updated":"2023-04-27T07:57:38Z","snapshot_observed_at":"2026-07-06T15:20:37.222868Z","submitted_at":"2023-04-27T07:57:38Z","title":"Edit Everything: A Text-Guided Generative System for Images Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14006","snapshot_observed_at":"2026-08-08T10:16:59.177313Z","title":"Edit every- thing: A text-guided generative system for images editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-09T17:03:33.790317Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.177313Z"},"links":{"cited_paper":"/paper/2304.14006","citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:1cadb1eed4aef739d5f0b74bd9782dea7a04989ed162a033ee3781b3b63bd5d3","observation_id":"9537121a-16c2-4b40-97af-8c4eb9abd83c","resolution":{"observed_at":"2026-08-08T10:16:59.177313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.514421Z","title":"Al- varez Xie, Enze and Ping Luo","venue":null,"work_id":"f10502db-27f2-4eb7-8c7d-6f043425c55a","year":2021},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-09T17:03:33.790317Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.181981Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:776080d7e218f036c84618d68a6cf71d02ff430e539c8a6cb19f67a2a62039be","observation_id":"9dd8c4ff-974b-4cf0-9b75-dd6ab96431cd","resolution":{"observed_at":"2026-08-08T10:16:59.519028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11811","last_updated":"2025-02-12T05:16:17Z","snapshot_observed_at":"2026-08-10T07:45:42.543446Z","submitted_at":"2024-08-21T17:57:06Z","title":"EmbodiedSAM: Online Segment Any 3D Thing in Real Time","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11811","snapshot_observed_at":"2026-08-08T10:16:59.186201Z","title":"Embodiedsam: Online segment any 3d thing in real time","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-09T17:03:33.790317Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.186201Z"},"links":{"cited_paper":"/paper/2408.11811","citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:145eadfe929550265227a5c69f5f7626abfc8a5adc2e6ff16eec75e0ea76300f","observation_id":"9d884c20-b936-46d8-b45e-0f27a2c2ab21","resolution":{"observed_at":"2026-08-08T10:16:59.186201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.498526Z","title":"Seg- ment everything everywhere all at once","venue":null,"work_id":"980f27e0-ef96-43ed-9b5d-74346bbdbbb9","year":2023},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-09T17:03:33.790317Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.190848Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:a084a98e00acb9768c8b8cd36cb76a92655619fb16c8e821fb1507a481b41d73","observation_id":"19655146-7fab-4feb-94f2-f5babd7c3b66","resolution":{"observed_at":"2026-08-08T10:16:59.503984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.482613Z","title":"Saliency detection via graph-based man- ifold ranking","venue":null,"work_id":"a2c16c2f-c3e2-41b6-8a8b-a25c31dbeb14","year":2013},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-09T17:03:33.790317Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.195344Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:17e90943b64d32afd34222a473f2e55ca9b9130e3016f5ba23d7d3fe62e31ac4","observation_id":"e1ddc00c-fd76-4df8-b7ba-381cddafff3b","resolution":{"observed_at":"2026-08-08T10:16:59.487569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.467860Z","title":"Decoupling features in hi- erarchical propagation for video object segmentation","venue":null,"work_id":"40d0e521-8d6e-4318-9d79-1444395f57ca","year":2022},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-09T17:03:33.790317Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.199856Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:99f953eccd738b0a7b34293f6449616186fb42e200df59362f97d9a979862d33","observation_id":"2cb4b2d7-a7e0-4d0e-9800-f04c949f6528","resolution":{"observed_at":"2026-08-08T10:16:59.472551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.452750Z","title":"Multi-view aggregation network for dichoto- mous image segmentation","venue":null,"work_id":"ec03a4b3-f37e-46d9-8823-7b4aa4c09301","year":2024},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-09T17:03:33.790317Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.204599Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:b6e39ad53798e018d3fe82cdac31f9f0f4cf5e19cb7a7944617c8a56d40ac0c6","observation_id":"118895c3-fe4d-4939-a665-eb562c218552","resolution":{"observed_at":"2026-08-08T10:16:59.457475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06790","last_updated":"2023-04-13T19:23:52Z","snapshot_observed_at":"2026-08-05T23:54:40.289344Z","submitted_at":"2023-04-13T19:23:52Z","title":"Inpaint Anything: Segment Anything Meets Image Inpainting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06790","snapshot_observed_at":"2026-08-08T10:16:59.208911Z","title":"Inpaint anything: Segment anything meets image inpainting","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-09T17:03:33.790317Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.208911Z"},"links":{"cited_paper":"/paper/2304.06790","citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:658397e952a5174435713e8f4e50ae08e6b1ee35302d925c594566cf566a28e8","observation_id":"223e78f5-7d9e-47c8-8291-4086f19121d8","resolution":{"observed_at":"2026-08-08T10:16:59.208911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.436800Z","title":"Segfix: Model-agnostic boundary refinement for segmenta- tion","venue":null,"work_id":"e68ab236-0933-40d0-8653-0ba51606cdf7","year":2020},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-09T17:03:33.790317Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.213808Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:947b19a1e2e7f07d440e2263cf81c1b803af8359d76505284a2453a39cc1fc31","observation_id":"5411252a-2879-49c9-b573-a0f462db2a1a","resolution":{"observed_at":"2026-08-08T10:16:59.441804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.418254Z","title":"Towards high-resolution salient object detec- tion","venue":null,"work_id":"66bbf495-e11f-4c7a-a66e-e3d6a6829ecb","year":2019},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-09T17:03:33.790317Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.218287Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:6af995fe6f79f0d7c412054ae0f3b165fec790bd0f2891dd29016ab5d3094eda","observation_id":"ef5fbb56-639f-4430-9313-b0eecc9fd3df","resolution":{"observed_at":"2026-08-08T10:16:59.425908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.222616Z","title":"Pyramid scene parsing network","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-09T17:03:33.790317Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.222616Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:9278e05174c9b5f79469e1ea5823411d0c6046c41e966098f34841c023b3ac1f","observation_id":"df961242-06c7-4beb-a5ca-48a9fab72097","resolution":{"observed_at":"2026-08-08T10:16:59.222616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T17:03:33.790317Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":30},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 0 inbound Pith citation observations for arXiv:2502.09660."}