{"as_of":"2026-08-09T19:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:eedcdb38569977b3c1ea363d8371069e0a3137c5d5fa6a6b5e6afc295fd574b2","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":36,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T17:11:06.887432Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T18:13:49.304240Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":"2305.06558","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-06-29T18:13:49.304240Z","title":"arXiv preprint arXiv:2305.06558 (2023)","venue":null,"work_id":"3adaf7b1-65ed-4639-bb5a-f427052b8b58","year":2023},"citing_paper":{"arxiv_id":"2308.08089","last_updated":"2023-08-16T01:43:41Z","snapshot_observed_at":"2026-07-06T16:06:38.424057Z","submitted_at":"2023-08-16T01:43:41Z","title":"DragNUWA: Fine-grained Control in Video Generation by Integrating Text, Image, and Trajectory","version":1},"reference_index":141,"source":"arxiv_source","source_observed_at":"2026-05-20T13:03:57.828598Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2308.08089"},"observation_digest":"sha256:d2695b6c2c398f9fa36c55f70e1cacb6c619aa5d2fa423d79b60146a26084220","observation_id":"99305b33-8589-4c07-9df4-c17ffe475cc8","resolution":{"observed_at":"2026-05-20T13:03:58.147228Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":"2305.06558","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-06-29T18:13:49.304240Z","title":"arXiv preprint arXiv:2305.06558 (2023)","venue":null,"work_id":"3adaf7b1-65ed-4639-bb5a-f427052b8b58","year":2023},"citing_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T13:56:25.331304Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2408.00714"},"observation_digest":"sha256:334dda93270c91affeed352a1827af304647696052f53b819b6a12f91faf9449","observation_id":"0ff62b57-678d-45e7-b2a5-9c5b361a04b4","resolution":{"observed_at":"2026-05-10T13:56:25.371685Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":"2305.06558","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-06-29T18:13:49.304240Z","title":"arXiv preprint arXiv:2305.06558 (2023)","venue":null,"work_id":"3adaf7b1-65ed-4639-bb5a-f427052b8b58","year":2023},"citing_paper":{"arxiv_id":"2410.04960","last_updated":"2026-06-04T11:59:03Z","snapshot_observed_at":"2026-08-02T12:51:51.839797Z","submitted_at":"2024-10-07T11:59:54Z","title":"On Efficient Variants of Segment Anything Model: A Survey","version":5},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-23T19:42:24.122342Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2410.04960"},"observation_digest":"sha256:f7aab1c1aea62dd1647af05fe8457f9d57ba61bd173aca8fa7eec593854daa10","observation_id":"aad9540f-c6dd-42f1-a3a4-4ce68d8109d5","resolution":{"observed_at":"2026-05-23T19:43:23.490908Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":"2305.06558","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-06-29T18:13:49.304240Z","title":"arXiv preprint arXiv:2305.06558 (2023)","venue":null,"work_id":"3adaf7b1-65ed-4639-bb5a-f427052b8b58","year":2023},"citing_paper":{"arxiv_id":"2411.15115","last_updated":"2026-04-20T17:59:36Z","snapshot_observed_at":"2026-08-02T10:06:23.710148Z","submitted_at":"2024-11-22T18:31:47Z","title":"Self-Correcting Text-to-Video Generation with Misalignment Detection and Localized Refinement","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-23T08:25:01.468957Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2411.15115"},"observation_digest":"sha256:9d5fbe021dc6475561274176bc5acb1a6cb13b017664c09a9813e98bfaee835a","observation_id":"dbfacbdb-dc75-4c8f-93df-277c442ea72b","resolution":{"observed_at":"2026-05-23T08:25:29.380265Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-08-09T17:11:06.887432Z","title":"Segment and track anything,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00960","last_updated":"2025-02-02T23:52:37Z","snapshot_observed_at":"2026-08-09T17:03:54.722794Z","submitted_at":"2025-02-02T23:52:37Z","title":"SAM-guided Pseudo Label Enhancement for Multi-modal 3D Semantic Segmentation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-09T17:11:06.887432Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2502.00960"},"observation_digest":"sha256:2f63d3e706c81f01c2e73ea3da3e29b7cebb6ace4ff9d44bf0917b3f86cb8bbc","observation_id":"bca115e4-1bfd-4dd2-9908-fdd7d2fa1fb5","resolution":{"observed_at":"2026-08-09T17:11:06.887432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-08-09T05:23:20.253205Z","title":"Segment and track anything,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03266","last_updated":"2025-02-05T15:22:20Z","snapshot_observed_at":"2026-08-09T05:16:55.433931Z","submitted_at":"2025-02-05T15:22:20Z","title":"ZISVFM: Zero-Shot Object Instance Segmentation in Indoor Robotic Environments with Vision Foundation Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-09T05:23:20.253205Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2502.03266"},"observation_digest":"sha256:92afe7fcb30806f209d0af75376de4f2550899230318d35541137d7107480630","observation_id":"ed34e449-ddcb-432b-8bfb-19ae0bc3e577","resolution":{"observed_at":"2026-08-09T05:23:20.253205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-08-08T14:29:00.503655Z","title":"Segment and track anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06756","last_updated":"2025-03-16T10:12:23Z","snapshot_observed_at":"2026-08-09T04:04:20.740573Z","submitted_at":"2025-02-10T18:33:15Z","title":"SAMRefiner: Taming Segment Anything Model for Universal Mask Refinement","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T14:29:00.503655Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2502.06756"},"observation_digest":"sha256:53ddf263dbe67dedc77cf77c78e82005223970ec7cf14defebb0292a1014ad64","observation_id":"aada70c0-8b73-4e17-80ac-3f01202fb14d","resolution":{"observed_at":"2026-08-08T14:29:00.503655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-08-08T11:04:52.457436Z","title":"Segment and track anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08054","last_updated":"2025-02-14T00:15:42Z","snapshot_observed_at":"2026-08-08T12:43:49.466774Z","submitted_at":"2025-02-12T01:31:01Z","title":"COMBO-Grasp: Learning Constraint-Based Manipulation for Bimanual Occluded Grasping","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T11:04:52.457436Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2502.08054"},"observation_digest":"sha256:b0bbb1281a2fa52a88a6deb2b5bc336e012ab9378511d5f64344feede87ff3aa","observation_id":"3326b1ed-f614-48c3-a81e-97ed8d14275c","resolution":{"observed_at":"2026-08-08T11:04:52.457436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-08-07T13:52:24.826217Z","title":"Segment and track anything.arXiv preprint arXiv:2305.06558, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20710","last_updated":"2025-05-27T04:36:26Z","snapshot_observed_at":"2026-08-08T19:03:33.923226Z","submitted_at":"2025-05-27T04:36:26Z","title":"Hierarchical Instruction-aware Embodied Visual Tracking","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:24.826217Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2505.20710"},"observation_digest":"sha256:f236cfb4dc16651c416e312a1d0f29eb15c3191f3583fd03d47d9ba7636a053f","observation_id":"f0496b03-a06d-45e7-a7f5-e8825b1c0182","resolution":{"observed_at":"2026-08-07T13:52:24.826217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-08-07T11:52:38.984260Z","title":"Segment and track anything.arXiv:2305.06558, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01304","last_updated":"2025-06-02T04:30:14Z","snapshot_observed_at":"2026-08-07T11:42:31.580083Z","submitted_at":"2025-06-02T04:30:14Z","title":"SAM-I2V: Upgrading SAM to Support Promptable Video Segmentation with Less than 0.2% Training Cost","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:38.984260Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2506.01304"},"observation_digest":"sha256:9ec361fab1db6269028439963c0965d85a3f6a81d412beb33c57b7cb2e49166c","observation_id":"9b1cc4fd-526c-497a-b21e-a3484ac88c49","resolution":{"observed_at":"2026-08-07T11:52:38.984260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-08-07T10:50:50.093556Z","title":"Zeqi Gu, Wenqi Xian, Noah Snavely, and Abe Davis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04228","last_updated":"2025-06-04T17:59:58Z","snapshot_observed_at":"2026-08-07T10:42:55.229411Z","submitted_at":"2025-06-04T17:59:58Z","title":"LayerFlow: A Unified Model for Layer-aware Video Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:50:50.093556Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2506.04228"},"observation_digest":"sha256:707df3e67a3ce96b06b6bf456039d5ea8a7b5e60476444bb31bc1a5a4b7692af","observation_id":"29f7552e-8ec6-4694-ac33-60863cf5c5c7","resolution":{"observed_at":"2026-08-07T10:50:50.093556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-08-07T10:28:09.287312Z","title":"Segment and track anything.arXiv preprint arXiv:2305.06558, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05302","last_updated":"2025-06-05T17:51:39Z","snapshot_observed_at":"2026-08-09T01:44:49.494240Z","submitted_at":"2025-06-05T17:51:39Z","title":"Perceive Anything: Recognize, Explain, Caption, and Segment Anything in Images and Videos","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:09.287312Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2506.05302"},"observation_digest":"sha256:d525b9c0ebb8215446ed1b931451d4d8f98cb3cd15b03d1af9e61fa06d70a650","observation_id":"917015bf-08bc-43be-87e3-d8b9bc2d7aa5","resolution":{"observed_at":"2026-08-07T10:28:09.287312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-08-07T00:34:20.234594Z","title":"Segment and track anything,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13552","last_updated":"2026-07-17T06:30:35Z","snapshot_observed_at":"2026-08-08T10:23:57.140597Z","submitted_at":"2025-06-16T14:39:03Z","title":"A Comprehensive Survey on Video Scene Parsing:Advances, Challenges, and Prospects","version":2},"reference_index":164,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:20.234594Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2506.13552"},"observation_digest":"sha256:0b6292a351727e6225304cce2d797f24f65ac13193e52293e8e8546cf20879a0","observation_id":"736f90f5-e8ac-4755-8c8e-9cca77784074","resolution":{"observed_at":"2026-08-07T00:34:20.234594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-08-06T21:58:20.179134Z","title":"Segment and track anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:20.179134Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:6d0a33b4690854c8b8d8891eee60d4e8a1153f8255f72f2c402b133ad261ec57","observation_id":"9fb9494b-f604-4bec-bb6a-b100b8452b68","resolution":{"observed_at":"2026-08-06T21:58:20.179134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-08-06T21:53:32.123934Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23121","last_updated":"2025-07-14T02:03:48Z","snapshot_observed_at":"2026-08-09T04:48:03.044154Z","submitted_at":"2025-06-29T07:05:27Z","title":"CRISP-SAM2: SAM2 with Cross-Modal Interaction and Semantic Prompting for Multi-Organ Segmentation","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:32.123934Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2506.23121"},"observation_digest":"sha256:9d978bf7e3b36831287d3fa5634bdbe44bcb5cf6679944d981f9c63737e64384","observation_id":"ee9369df-9b15-406f-94ae-1f7bc5d66af0","resolution":{"observed_at":"2026-08-06T21:53:32.123934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-08-06T20:40:06.711380Z","title":"Segment and track anything,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02294","last_updated":"2025-07-03T04:06:04Z","snapshot_observed_at":"2026-08-08T23:35:09.314476Z","submitted_at":"2025-07-03T04:06:04Z","title":"ViRefSAM: Visual Reference-Guided Segment Anything Model for Remote Sensing Segmentation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T20:40:06.711380Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2507.02294"},"observation_digest":"sha256:896457f1359327483f1d0fbe71efbf46bd7e5664071350f8208547a914effc6d","observation_id":"fe661157-e11b-41fb-83bf-d5599062b8c6","resolution":{"observed_at":"2026-08-06T20:40:06.711380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-08-06T20:31:50.844918Z","title":"Segment and track anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02479","last_updated":"2025-07-03T09:36:44Z","snapshot_observed_at":"2026-08-06T20:40:58.005114Z","submitted_at":"2025-07-03T09:36:44Z","title":"CrowdTrack: A Benchmark for Difficult Multiple Pedestrian Tracking in Real Scenarios","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:31:50.844918Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2507.02479"},"observation_digest":"sha256:f4a3f7ade5fc6aac11dac8f3396cbd7fae147196d14ad21aeb0957f65cb2e51f","observation_id":"0dc380bd-5ec3-4a86-9b19-408a2abb5427","resolution":{"observed_at":"2026-08-06T20:31:50.844918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-08-06T14:44:58.782053Z","title":"Segment and track anything,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.18023","last_updated":"2025-07-24T01:48:50Z","snapshot_observed_at":"2026-08-08T14:19:09.360905Z","submitted_at":"2025-07-24T01:48:50Z","title":"High-fidelity 3D Gaussian Inpainting: preserving multi-view consistency and photorealistic details","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T14:44:58.782053Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2507.18023"},"observation_digest":"sha256:9a7d76ff2f1725adfac2225afd2836354595ea2948be64a3e1765a33ab5b0724","observation_id":"9cdf3218-26e9-44f6-b31c-a370dfcdc5a4","resolution":{"observed_at":"2026-08-06T14:44:58.782053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-08-05T21:57:09.363139Z","title":"Segment and track anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07747","last_updated":"2025-08-11T08:27:57Z","snapshot_observed_at":"2026-08-05T21:56:40.030550Z","submitted_at":"2025-08-11T08:27:57Z","title":"Grouped Speculative Decoding for Autoregressive Image Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T21:57:09.363139Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2508.07747"},"observation_digest":"sha256:bca835d0facff783b420458613d748afe2cf1deb1b7986a0583e4912226730ee","observation_id":"e23316d3-68b9-4291-b465-fdcda0340cb3","resolution":{"observed_at":"2026-08-05T21:57:09.363139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-08-05T22:29:52.721427Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.08320","last_updated":"2025-08-09T12:22:40Z","snapshot_observed_at":"2026-08-05T22:29:51.100733Z","submitted_at":"2025-08-09T12:22:40Z","title":"Representative Volume Element: Existence and Extent in Cracked Heterogeneous Medium","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T22:29:52.721427Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2508.08320"},"observation_digest":"sha256:d57fbbf1ce9c186f7596aa88fef80e79cb2355b22a59fe0953f347c7907b6f8d","observation_id":"538a1d52-85c3-4e25-be6c-d8fa0183b243","resolution":{"observed_at":"2026-08-05T22:29:52.721427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":"2305.06558","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-06-29T18:13:49.304240Z","title":"arXiv preprint arXiv:2305.06558 (2023)","venue":null,"work_id":"3adaf7b1-65ed-4639-bb5a-f427052b8b58","year":2023},"citing_paper":{"arxiv_id":"2508.10934","last_updated":"2025-08-12T18:39:13Z","snapshot_observed_at":"2026-07-06T22:13:09.586800Z","submitted_at":"2025-08-12T18:39:13Z","title":"ViPE: Video Pose Engine for 3D Geometric Perception","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-16T16:41:08.620285Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2508.10934"},"observation_digest":"sha256:91435c602c6b940ae06b5aef2f09ff4029af748c55ba654164d5e691d9b5f9ef","observation_id":"f9e0e54b-bce0-41ea-a5b5-a435ff99900e","resolution":{"observed_at":"2026-05-16T16:41:08.664360Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-08-05T18:34:23.512742Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.14465","last_updated":"2025-08-20T06:40:34Z","snapshot_observed_at":"2026-08-07T20:12:58.792553Z","submitted_at":"2025-08-20T06:40:34Z","title":"DreamSwapV: Mask-guided Subject Swapping for Any Customized Video Editing","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T18:34:23.512742Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2508.14465"},"observation_digest":"sha256:d1b00848453a5f944f6a6b9ba64955ae49ccaf8e02e16468553a3865924c6cea","observation_id":"bb55ce6e-db0c-41a4-9ca2-2c958af88378","resolution":{"observed_at":"2026-08-05T18:34:23.512742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-08-05T14:01:16.517409Z","title":"Segment and track anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-09T01:44:48.919022Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:16.517409Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2508.21809"},"observation_digest":"sha256:54eb55962222612325058545679f8b6f2652570f26005eb456dc0620d975e8ea","observation_id":"d3d34e96-2a6a-4207-a531-14fd3f85fee9","resolution":{"observed_at":"2026-08-05T14:01:16.517409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-08-05T00:05:11.934372Z","title":"Segment and track anything,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06201","last_updated":"2025-09-07T20:28:21Z","snapshot_observed_at":"2026-08-08T09:09:09.526571Z","submitted_at":"2025-09-07T20:28:21Z","title":"Grasp-MPC: Closed-Loop Visual Grasping via Value-Guided Model Predictive Control","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T00:05:11.934372Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2509.06201"},"observation_digest":"sha256:8ca2d6827456c49f74a0879628be08abab72c36bc4f7db4d88fa5618f2554ea4","observation_id":"22ef0701-514c-41be-a049-6a883b793cc2","resolution":{"observed_at":"2026-08-05T00:05:11.934372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-08-04T20:44:40.124432Z","title":"Segment and track anything,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08354","last_updated":"2025-09-10T07:44:12Z","snapshot_observed_at":"2026-08-04T20:44:29.430006Z","submitted_at":"2025-09-10T07:44:12Z","title":"Grasp Like Humans: Learning Generalizable Multi-Fingered Grasping from Human Proprioceptive Sensorimotor Integration","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T20:44:40.124432Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2509.08354"},"observation_digest":"sha256:bf999e315cbdfa7dc4d04930cde3dc013ad968505dad012ce411708f38e076d2","observation_id":"31a06d06-832b-4879-b307-bd7cd3992c96","resolution":{"observed_at":"2026-08-04T20:44:40.124432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-08-04T17:25:30.813136Z","title":"Cheng, L","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10948","last_updated":"2025-09-13T19:10:35Z","snapshot_observed_at":"2026-08-04T17:25:24.156060Z","submitted_at":"2025-09-13T19:10:35Z","title":"ViSTR-GP: Online Cyberattack Detection via Vision-to-State Tensor Regression and Gaussian Processes in Automated Robotic Operations","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T17:25:30.813136Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2509.10948"},"observation_digest":"sha256:087a345004b49a648f463d0a1be511af39ca49d34a67222c949710b57e9795de","observation_id":"51f54a4b-81d8-4b67-b2c5-cbcaa0599749","resolution":{"observed_at":"2026-08-04T17:25:30.813136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":"2305.06558","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-06-29T18:13:49.304240Z","title":"arXiv preprint arXiv:2305.06558 (2023)","venue":null,"work_id":"3adaf7b1-65ed-4639-bb5a-f427052b8b58","year":2023},"citing_paper":{"arxiv_id":"2510.14244","last_updated":"2026-05-12T20:27:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-16T02:55:04Z","title":"Reinforcement Learning for Unsupervised Domain Adaptation in Spatio-Temporal Echocardiography Segmentation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-18T06:53:21.438159Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2510.14244"},"observation_digest":"sha256:2e6743339411feb7831d21f66038f0e91b8125bb93708a56e15021d459aa71d8","observation_id":"8f735f20-1c5b-47cb-8360-7803ec16e0e9","resolution":{"observed_at":"2026-05-18T06:56:01.667572Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":"2305.06558","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-06-29T18:13:49.304240Z","title":"arXiv preprint arXiv:2305.06558 (2023)","venue":null,"work_id":"3adaf7b1-65ed-4639-bb5a-f427052b8b58","year":2023},"citing_paper":{"arxiv_id":"2512.17445","last_updated":"2026-04-08T21:08:41Z","snapshot_observed_at":"2026-07-06T22:39:33.919723Z","submitted_at":"2025-12-19T10:57:03Z","title":"LangDriveCTRL: Natural Language Controllable Driving Scene Editing with Multi-modal Agents","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T20:56:58.770875Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2512.17445"},"observation_digest":"sha256:00b7869dfeee5f119531158e33e7762a180645902c244c8a2f236c32a9d0a110","observation_id":"638f907f-54be-4905-87a0-ba068f0665b0","resolution":{"observed_at":"2026-05-16T20:58:31.814788Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-08-03T00:02:11.238949Z","title":"Segment and track anything,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.11804","last_updated":"2026-02-12T10:35:35Z","snapshot_observed_at":"2026-08-05T10:01:02.742069Z","submitted_at":"2026-02-12T10:35:35Z","title":"Efficient Segment Anything with Depth-Aware Fusion and Limited Training Data","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:11.238949Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2602.11804"},"observation_digest":"sha256:a45a97654faa98593db13864dc07783bd05ecc768681816694035ada8913cc7a","observation_id":"c67fe298-7b32-47f0-aff3-30da96baf5c1","resolution":{"observed_at":"2026-08-03T00:02:11.238949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-07-13T18:24:58.428701Z","title":"arXiv:2305.06558 (2023) 4","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.25168","last_updated":"2026-06-26T05:47:15Z","snapshot_observed_at":"2026-08-09T18:33:47.669976Z","submitted_at":"2026-03-26T08:37:32Z","title":"ET-SAM: Efficient Point Prompt Prediction in SAM for Unified Scene Text Detection and Layout Analysis","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-13T18:24:58.428701Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2603.25168"},"observation_digest":"sha256:db5dc8f98a1cec9ae813a677254be2d76eca12c16777eee581a07234711fe9c1","observation_id":"8ec5f0ab-ef26-47f4-8ee7-153c2e331ded","resolution":{"observed_at":"2026-07-13T18:24:58.428701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":"2305.06558","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-06-29T18:13:49.304240Z","title":"arXiv preprint arXiv:2305.06558 (2023)","venue":null,"work_id":"3adaf7b1-65ed-4639-bb5a-f427052b8b58","year":2023},"citing_paper":{"arxiv_id":"2604.08546","last_updated":"2026-04-09T17:59:57Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:59:57Z","title":"When Numbers Speak: Aligning Textual Numerals and Visual Instances in Text-to-Video Diffusion Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T18:39:26.420463Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2604.08546"},"observation_digest":"sha256:76e7edd4ee8ab9450dcf6f38316a8a7d7ccb3725b8f86280b06115f174fe71a7","observation_id":"521aac84-4e08-43cf-ad2c-a24e5a4ea3b5","resolution":{"observed_at":"2026-05-11T00:10:53.007612Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":"2305.06558","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-06-29T18:13:49.304240Z","title":"arXiv preprint arXiv:2305.06558 (2023)","venue":null,"work_id":"3adaf7b1-65ed-4639-bb5a-f427052b8b58","year":2023},"citing_paper":{"arxiv_id":"2604.20305","last_updated":"2026-04-22T08:06:32Z","snapshot_observed_at":"2026-07-06T23:06:44.624357Z","submitted_at":"2026-04-22T08:06:32Z","title":"AdaTracker: Learning Adaptive In-Context Policy for Cross-Embodiment Active Visual Tracking","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T00:34:26.106672Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2604.20305"},"observation_digest":"sha256:bb9ec957f9a15e5fef5b290a164dbb2ef675e97df91c27fa3054f6c8b1413154","observation_id":"b755e582-44c9-4a1b-85f9-40414dcdad08","resolution":{"observed_at":"2026-05-10T00:34:47.308672Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":"2305.06558","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-06-29T18:13:49.304240Z","title":"arXiv preprint arXiv:2305.06558 (2023)","venue":null,"work_id":"3adaf7b1-65ed-4639-bb5a-f427052b8b58","year":2023},"citing_paper":{"arxiv_id":"2604.23173","last_updated":"2026-04-25T06:55:13Z","snapshot_observed_at":"2026-08-06T21:26:24.889698Z","submitted_at":"2026-04-25T06:55:13Z","title":"One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-08T08:50:27.871886Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2604.23173"},"observation_digest":"sha256:eb75fd2701035f328d6555b1750f696cd341e4d4171003de7a975d777aeef25a","observation_id":"119424ae-d507-4a02-a73c-9eb699106c1d","resolution":{"observed_at":"2026-05-11T20:31:11.807561Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":"2305.06558","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-06-29T18:13:49.304240Z","title":"arXiv preprint arXiv:2305.06558 (2023)","venue":null,"work_id":"3adaf7b1-65ed-4639-bb5a-f427052b8b58","year":2023},"citing_paper":{"arxiv_id":"2606.27655","last_updated":"2026-06-26T02:18:43Z","snapshot_observed_at":"2026-08-07T21:38:32.698119Z","submitted_at":"2026-06-26T02:18:43Z","title":"Temporal-Emerged Prompting for Segment Anything in Multiframe Infrared Small Target Detection","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-06-29T05:13:51.469018Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2606.27655"},"observation_digest":"sha256:7fdbfae584efe664e6eb541e1429191151f6c7d0d65da75d3771be4a618b794f","observation_id":"456f231d-bb91-41ed-b7cc-04ac797e0193","resolution":{"observed_at":"2026-06-29T18:13:49.306052Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-08-06T00:48:38.659879Z","title":"arXiv preprint arXiv:2305.06558 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03147","last_updated":"2026-08-05T06:08:54Z","snapshot_observed_at":"2026-08-08T23:10:46.664864Z","submitted_at":"2026-08-04T05:24:05Z","title":"CROSS: Cascaded Distillation and Dual-Constraint Grounding for Remote Sensing Referring Segmentation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T00:48:38.659879Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2608.03147"},"observation_digest":"sha256:1075bb42d5ec8c1596137fec7e5e65001faf535df3eb2c26267348ac983eed49","observation_id":"bfbb65b8-fc5d-4102-8d79-1dc80c1f94fd","resolution":{"observed_at":"2026-08-06T00:48:38.659879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-08-08T00:49:54.922688Z","title":"arXiv preprint arXiv:2305.06558 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03147","last_updated":"2026-08-05T06:08:54Z","snapshot_observed_at":"2026-08-08T23:10:46.664864Z","submitted_at":"2026-08-04T05:24:05Z","title":"CROSS: Cascaded Distillation and Dual-Constraint Grounding for Remote Sensing Referring Segmentation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T00:49:54.922688Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2608.03147"},"observation_digest":"sha256:858b2b0d87b60e2a8641466ab0c0a523bda4430010935c65efb9d805f9429c08","observation_id":"48fc112f-e9ba-41a2-acfd-e23884ca5a27","resolution":{"observed_at":"2026-08-08T00:49:54.922688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2305.06558/citation-record","integrity":"/paper/2305.06558/integrity","json":"/paper/2305.06558/citation-record.json","paper":"/paper/2305.06558"},"outbound":[],"paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 36 inbound Pith citation observations for arXiv:2305.06558."}