{"as_of":"2026-08-08T23:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:93bf95f4b39c7acd611e55aa467541b16ef7a11984e9d3f442692711fc07c068","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":20,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T00:49:55.197773Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T08:06:57.772386Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.20076","last_updated":"2025-03-10T12:34:24Z","snapshot_observed_at":"2026-08-06T23:39:09.398813Z","submitted_at":"2024-06-28T17:38:18Z","title":"EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model","version":5},"cited_work":{"arxiv_id":"2406.20076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.20076","snapshot_observed_at":"2026-07-10T08:06:57.772386Z","title":"Evf-sam: Early vision-language fusion for text-prompted segment anything model","venue":"cs.CV","work_id":"9c74bfe1-f3f0-49c7-b929-3627d1d4fc12","year":2024},"citing_paper":{"arxiv_id":"2412.08110","last_updated":"2026-05-07T17:14:28Z","snapshot_observed_at":"2026-08-02T20:28:50.583436Z","submitted_at":"2024-12-11T05:36:18Z","title":"The ART of Composition: Attention-Regularized Training for Compositional Visual Grounding","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-23T07:24:01.527093Z"},"links":{"cited_paper":"/paper/2406.20076","citing_paper":"/paper/2412.08110"},"observation_digest":"sha256:984599eeda9a186723f91a93003be17d08ab4e49d3e8706346ad7c7ce4bee77a","observation_id":"5c63839f-a28c-486d-b7c6-d57edf0e1e06","resolution":{"observed_at":"2026-05-23T07:25:28.430275Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20076","last_updated":"2025-03-10T12:34:24Z","snapshot_observed_at":"2026-08-06T23:39:09.398813Z","submitted_at":"2024-06-28T17:38:18Z","title":"EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model","version":5},"cited_work":{"arxiv_id":"2406.20076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.20076","snapshot_observed_at":"2026-07-10T08:06:57.772386Z","title":"Evf-sam: Early vision-language fusion for text-prompted segment anything model","venue":"cs.CV","work_id":"9c74bfe1-f3f0-49c7-b929-3627d1d4fc12","year":2024},"citing_paper":{"arxiv_id":"2501.04001","last_updated":"2025-11-03T17:35:29Z","snapshot_observed_at":"2026-08-08T01:58:42.644918Z","submitted_at":"2025-01-07T18:58:54Z","title":"Sa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and Videos","version":3},"reference_index":118,"source":"pdf_text","source_observed_at":"2026-05-16T11:39:22.340737Z"},"links":{"cited_paper":"/paper/2406.20076","citing_paper":"/paper/2501.04001"},"observation_digest":"sha256:0da269ef3fe1ae680069395fd46f8340dd4970621df2aa570d8c14a5ab703a79","observation_id":"ba6c847b-5d56-4dda-ab62-a23bebb4c965","resolution":{"observed_at":"2026-05-16T11:39:22.556638Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20076","last_updated":"2025-03-10T12:34:24Z","snapshot_observed_at":"2026-08-06T23:39:09.398813Z","submitted_at":"2024-06-28T17:38:18Z","title":"EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.20076","snapshot_observed_at":"2026-08-07T14:47:26.416689Z","title":"Evf-sam: Early vision-language fusion for text-prompted seg- ment anything model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17695","last_updated":"2025-05-23T10:05:16Z","snapshot_observed_at":"2026-08-07T14:40:03.167039Z","submitted_at":"2025-05-23T10:05:16Z","title":"SynRES: Towards Referring Expression Segmentation in the Wild via Synthetic Data","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:26.416689Z"},"links":{"cited_paper":"/paper/2406.20076","citing_paper":"/paper/2505.17695"},"observation_digest":"sha256:f9b1812444355247d39c962180b9b288e22a41beb6b3eef23d989a7ecec642eb","observation_id":"eea956fa-8b55-47b8-904c-11aabd935bef","resolution":{"observed_at":"2026-08-07T14:47:26.416689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20076","last_updated":"2025-03-10T12:34:24Z","snapshot_observed_at":"2026-08-06T23:39:09.398813Z","submitted_at":"2024-06-28T17:38:18Z","title":"EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.20076","snapshot_observed_at":"2026-08-07T11:44:12.137620Z","title":"Evf-sam: Early vision-language fusion for text-prompted segment anything model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01558","last_updated":"2025-06-02T11:36:25Z","snapshot_observed_at":"2026-08-07T11:36:04.057631Z","submitted_at":"2025-06-02T11:36:25Z","title":"SAM2-LOVE: Segment Anything Model 2 in Language-aided Audio-Visual Scenes","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:44:12.137620Z"},"links":{"cited_paper":"/paper/2406.20076","citing_paper":"/paper/2506.01558"},"observation_digest":"sha256:6136ea0c4688eb0326b606e05e24b9e8ccc183725960521e190d561d277322e5","observation_id":"d7f2f6e5-a0fd-4d05-91d9-d1a3c3424bb8","resolution":{"observed_at":"2026-08-07T11:44:12.137620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20076","last_updated":"2025-03-10T12:34:24Z","snapshot_observed_at":"2026-08-06T23:39:09.398813Z","submitted_at":"2024-06-28T17:38:18Z","title":"EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.20076","snapshot_observed_at":"2026-08-07T05:59:29.719733Z","title":"Evf-sam: Early vision-language fusion for text-prompted segment anything model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-07T05:52:18.719438Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:29.719733Z"},"links":{"cited_paper":"/paper/2406.20076","citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:4d5c4827c697acf14d24bb7db83c9814e41f92c92905cb6808d627600dd83eee","observation_id":"6c734f9e-ea84-4ac8-a2e5-80d9356fc318","resolution":{"observed_at":"2026-08-07T05:59:29.719733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20076","last_updated":"2025-03-10T12:34:24Z","snapshot_observed_at":"2026-08-06T23:39:09.398813Z","submitted_at":"2024-06-28T17:38:18Z","title":"EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.20076","snapshot_observed_at":"2026-08-06T22:40:36.054758Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21006","last_updated":"2025-06-26T04:46:28Z","snapshot_observed_at":"2026-08-08T07:44:48.135536Z","submitted_at":"2025-06-26T04:46:28Z","title":"Detection of Breast Cancer Lumpectomy Margin with SAM-incorporated Forward-Forward Contrastive Learning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T22:40:36.054758Z"},"links":{"cited_paper":"/paper/2406.20076","citing_paper":"/paper/2506.21006"},"observation_digest":"sha256:c5bcc0a73bbcbe3e469921d9dd18d5d5a4852d2afd8125c021c64814781e2fa8","observation_id":"cb421d72-2444-4831-b123-426b0b3e7b25","resolution":{"observed_at":"2026-08-06T22:40:36.054758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20076","last_updated":"2025-03-10T12:34:24Z","snapshot_observed_at":"2026-08-06T23:39:09.398813Z","submitted_at":"2024-06-28T17:38:18Z","title":"EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.20076","snapshot_observed_at":"2026-08-06T21:54:43.687107Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23121","last_updated":"2025-07-14T02:03:48Z","snapshot_observed_at":"2026-08-08T21:56:24.885396Z","submitted_at":"2025-06-29T07:05:27Z","title":"CRISP-SAM2: SAM2 with Cross-Modal Interaction and Semantic Prompting for Multi-Organ Segmentation","version":3},"reference_index":126,"source":"pdf_text","source_observed_at":"2026-08-06T21:54:43.687107Z"},"links":{"cited_paper":"/paper/2406.20076","citing_paper":"/paper/2506.23121"},"observation_digest":"sha256:77c15a4396633ea8a8b821d5e9e07d63fa5d56e4a3f5cdedf6f04a5916147d1b","observation_id":"62c7771d-d80f-4243-ae70-dab1685d75c1","resolution":{"observed_at":"2026-08-06T21:54:43.687107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20076","last_updated":"2025-03-10T12:34:24Z","snapshot_observed_at":"2026-08-06T23:39:09.398813Z","submitted_at":"2024-06-28T17:38:18Z","title":"EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model","version":5},"cited_work":{"arxiv_id":"2406.20076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.20076","snapshot_observed_at":"2026-07-10T08:06:57.772386Z","title":"Evf-sam: Early vision-language fusion for text-prompted segment anything model","venue":"cs.CV","work_id":"9c74bfe1-f3f0-49c7-b929-3627d1d4fc12","year":2024},"citing_paper":{"arxiv_id":"2511.16719","last_updated":"2026-03-28T16:54:56Z","snapshot_observed_at":"2026-08-07T05:59:39.049027Z","submitted_at":"2025-11-20T18:59:56Z","title":"SAM 3: Segment Anything with Concepts","version":2},"reference_index":161,"source":"arxiv_source","source_observed_at":"2026-05-17T20:22:46.220021Z"},"links":{"cited_paper":"/paper/2406.20076","citing_paper":"/paper/2511.16719"},"observation_digest":"sha256:7f2841eb1c6101b54a6f0c2712a92853ab9a09e8249cf5557c9f4aba4b1fcad1","observation_id":"f18181be-c505-4aa3-bef9-046aac89f670","resolution":{"observed_at":"2026-05-17T20:25:11.420980Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20076","last_updated":"2025-03-10T12:34:24Z","snapshot_observed_at":"2026-08-06T23:39:09.398813Z","submitted_at":"2024-06-28T17:38:18Z","title":"EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model","version":5},"cited_work":{"arxiv_id":"2406.20076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.20076","snapshot_observed_at":"2026-07-10T08:06:57.772386Z","title":"Evf-sam: Early vision-language fusion for text-prompted segment anything model","venue":"cs.CV","work_id":"9c74bfe1-f3f0-49c7-b929-3627d1d4fc12","year":2024},"citing_paper":{"arxiv_id":"2604.07916","last_updated":"2026-08-04T13:16:24Z","snapshot_observed_at":"2026-08-07T23:11:32.534256Z","submitted_at":"2026-04-09T07:37:09Z","title":"Tarot-SAM3: Training-free SAM3 for Any Referring Expression Segmentation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-10T18:11:13.376684Z"},"links":{"cited_paper":"/paper/2406.20076","citing_paper":"/paper/2604.07916"},"observation_digest":"sha256:060b2ffb5cb503542ab159db4f1f84fae4ff5138fb2a700b0beb3b8795418cab","observation_id":"276b06cd-f6f2-4a4f-a6f1-143db866ae1c","resolution":{"observed_at":"2026-05-11T05:21:01.008627Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20076","last_updated":"2025-03-10T12:34:24Z","snapshot_observed_at":"2026-08-06T23:39:09.398813Z","submitted_at":"2024-06-28T17:38:18Z","title":"EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model","version":5},"cited_work":{"arxiv_id":"2406.20076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.20076","snapshot_observed_at":"2026-07-10T08:06:57.772386Z","title":"Evf-sam: Early vision-language fusion for text-prompted segment anything model","venue":"cs.CV","work_id":"9c74bfe1-f3f0-49c7-b929-3627d1d4fc12","year":2024},"citing_paper":{"arxiv_id":"2604.18562","last_updated":"2026-04-22T02:31:50Z","snapshot_observed_at":"2026-08-04T10:02:00.731719Z","submitted_at":"2026-04-20T17:49:22Z","title":"AnchorSeg: Language Grounded Query Banks for Reasoning Segmentation","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-10T05:10:44.608959Z"},"links":{"cited_paper":"/paper/2406.20076","citing_paper":"/paper/2604.18562"},"observation_digest":"sha256:ef120fb89b1d9d8b8ac56b072e03c0a0dc2de3f143d54bf0fddd7574bc659c04","observation_id":"0aaeb7f0-5d2e-466a-96bd-bdc82a654fc6","resolution":{"observed_at":"2026-05-10T09:43:49.426512Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20076","last_updated":"2025-03-10T12:34:24Z","snapshot_observed_at":"2026-08-06T23:39:09.398813Z","submitted_at":"2024-06-28T17:38:18Z","title":"EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model","version":5},"cited_work":{"arxiv_id":"2406.20076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.20076","snapshot_observed_at":"2026-07-10T08:06:57.772386Z","title":"Evf-sam: Early vision-language fusion for text-prompted segment anything model","venue":"cs.CV","work_id":"9c74bfe1-f3f0-49c7-b929-3627d1d4fc12","year":2024},"citing_paper":{"arxiv_id":"2605.06351","last_updated":"2026-05-07T14:33:14Z","snapshot_observed_at":"2026-08-03T03:28:56.756773Z","submitted_at":"2026-05-07T14:33:14Z","title":"SIGMA-ASL: Sensor-Integrated Multimodal Dataset for Sign Language Recognition","version":1},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-05-08T07:04:47.169148Z"},"links":{"cited_paper":"/paper/2406.20076","citing_paper":"/paper/2605.06351"},"observation_digest":"sha256:87e73ed69b31a8222f8a91744db6844ac6db7ed3c2b35c3fc371366f3d7bb36a","observation_id":"ad041107-2c10-4d15-b05d-cf91ba74fd24","resolution":{"observed_at":"2026-05-11T21:06:11.352200Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20076","last_updated":"2025-03-10T12:34:24Z","snapshot_observed_at":"2026-08-06T23:39:09.398813Z","submitted_at":"2024-06-28T17:38:18Z","title":"EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model","version":5},"cited_work":{"arxiv_id":"2406.20076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.20076","snapshot_observed_at":"2026-07-10T08:06:57.772386Z","title":"Evf-sam: Early vision-language fusion for text-prompted segment anything model","venue":"cs.CV","work_id":"9c74bfe1-f3f0-49c7-b929-3627d1d4fc12","year":2024},"citing_paper":{"arxiv_id":"2605.19410","last_updated":"2026-05-19T06:04:23Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T06:04:23Z","title":"Vision Harnessing Agent for Open Ad-hoc Segmentation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:40.429412Z"},"links":{"cited_paper":"/paper/2406.20076","citing_paper":"/paper/2605.19410"},"observation_digest":"sha256:5fddfe9321540c43ece3f644999ae4be937c0408c3beeac93d3b4cb89c6631ab","observation_id":"fe24e2de-87e2-49c2-b47e-0b30bf539301","resolution":{"observed_at":"2026-05-20T05:53:04.383299Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20076","last_updated":"2025-03-10T12:34:24Z","snapshot_observed_at":"2026-08-06T23:39:09.398813Z","submitted_at":"2024-06-28T17:38:18Z","title":"EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model","version":5},"cited_work":{"arxiv_id":"2406.20076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.20076","snapshot_observed_at":"2026-07-10T08:06:57.772386Z","title":"Evf-sam: Early vision-language fusion for text-prompted segment anything model","venue":"cs.CV","work_id":"9c74bfe1-f3f0-49c7-b929-3627d1d4fc12","year":2024},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-07-06T23:30:44.092395Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"cited_paper":"/paper/2406.20076","citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:6bcb0db97e9ef4e90a8b4c93c7557f74f53324ca2258c570a299d14ce74fc689","observation_id":"c36a9fb7-f75a-4e05-bf97-86dff3564869","resolution":{"observed_at":"2026-05-20T05:28:05.240709Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20076","last_updated":"2025-03-10T12:34:24Z","snapshot_observed_at":"2026-08-06T23:39:09.398813Z","submitted_at":"2024-06-28T17:38:18Z","title":"EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model","version":5},"cited_work":{"arxiv_id":"2406.20076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.20076","snapshot_observed_at":"2026-07-10T08:06:57.772386Z","title":"Evf-sam: Early vision-language fusion for text-prompted segment anything model","venue":"cs.CV","work_id":"9c74bfe1-f3f0-49c7-b929-3627d1d4fc12","year":2024},"citing_paper":{"arxiv_id":"2605.24553","last_updated":"2026-05-23T12:39:37Z","snapshot_observed_at":"2026-07-06T23:34:38.098785Z","submitted_at":"2026-05-23T12:39:37Z","title":"IQA-Spider: Unifying Multi-Granularity Image Quality Assessment with Reasoning, Grounding and Referring","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T13:28:01.889147Z"},"links":{"cited_paper":"/paper/2406.20076","citing_paper":"/paper/2605.24553"},"observation_digest":"sha256:2f1fa9af68fd725a723e2b8feb14bddee7c12ab0dab67e61fb1fdc2fdc76743b","observation_id":"66b2baea-c095-4da5-8163-0da46a97be86","resolution":{"observed_at":"2026-06-30T13:34:40.563286Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20076","last_updated":"2025-03-10T12:34:24Z","snapshot_observed_at":"2026-08-06T23:39:09.398813Z","submitted_at":"2024-06-28T17:38:18Z","title":"EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model","version":5},"cited_work":{"arxiv_id":"2406.20076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.20076","snapshot_observed_at":"2026-07-10T08:06:57.772386Z","title":"Evf-sam: Early vision-language fusion for text-prompted segment anything model","venue":"cs.CV","work_id":"9c74bfe1-f3f0-49c7-b929-3627d1d4fc12","year":2024},"citing_paper":{"arxiv_id":"2605.26102","last_updated":"2026-05-31T07:20:32Z","snapshot_observed_at":"2026-07-06T23:36:01.564747Z","submitted_at":"2026-05-25T17:58:03Z","title":"InstructSAM: Segment Any Instance with Any Instructions","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-29T22:34:00.442420Z"},"links":{"cited_paper":"/paper/2406.20076","citing_paper":"/paper/2605.26102"},"observation_digest":"sha256:3a93b5896c60f84d62c0c648967189e4a3cb3ed9c4134e85f5e22c3026e85cca","observation_id":"0414d691-0d81-40c8-b5b1-36ef31c4b4b9","resolution":{"observed_at":"2026-06-29T22:44:02.029740Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20076","last_updated":"2025-03-10T12:34:24Z","snapshot_observed_at":"2026-08-06T23:39:09.398813Z","submitted_at":"2024-06-28T17:38:18Z","title":"EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model","version":5},"cited_work":{"arxiv_id":"2406.20076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.20076","snapshot_observed_at":"2026-07-10T08:06:57.772386Z","title":"Evf-sam: Early vision-language fusion for text-prompted segment anything model","venue":"cs.CV","work_id":"9c74bfe1-f3f0-49c7-b929-3627d1d4fc12","year":2024},"citing_paper":{"arxiv_id":"2606.04880","last_updated":"2026-06-02T17:59:57Z","snapshot_observed_at":"2026-08-06T01:54:13.672479Z","submitted_at":"2026-06-02T17:59:57Z","title":"MAOAM: Unified Object and Material Selection with Vision-Language Models","version":1},"reference_index":121,"source":"arxiv_source","source_observed_at":"2026-06-28T11:08:59.900161Z"},"links":{"cited_paper":"/paper/2406.20076","citing_paper":"/paper/2606.04880"},"observation_digest":"sha256:c2e22083c2eb5a76246b4c741ede90aa0e9b7966f4028269f2e52432612334e2","observation_id":"94431ffb-eb37-4d23-8da3-bd26278c199b","resolution":{"observed_at":"2026-07-02T02:16:26.324793Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20076","last_updated":"2025-03-10T12:34:24Z","snapshot_observed_at":"2026-08-06T23:39:09.398813Z","submitted_at":"2024-06-28T17:38:18Z","title":"EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model","version":5},"cited_work":{"arxiv_id":"2406.20076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.20076","snapshot_observed_at":"2026-07-10T08:06:57.772386Z","title":"Evf-sam: Early vision-language fusion for text-prompted segment anything model","venue":"cs.CV","work_id":"9c74bfe1-f3f0-49c7-b929-3627d1d4fc12","year":2024},"citing_paper":{"arxiv_id":"2607.08397","last_updated":"2026-07-09T12:21:06Z","snapshot_observed_at":"2026-08-06T16:27:25.843893Z","submitted_at":"2026-07-09T12:21:06Z","title":"Attribute Retrieving for Open-Vocabulary Endoscopic Compositional Referring Segmentation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-10T08:06:03.952787Z"},"links":{"cited_paper":"/paper/2406.20076","citing_paper":"/paper/2607.08397"},"observation_digest":"sha256:547db506826f67395ca25c3bd8511a5970cfe8ebb983530167b6f7ced546ad19","observation_id":"5523097c-b5eb-4508-b58f-4697d7e5016d","resolution":{"observed_at":"2026-07-10T08:06:57.773790Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20076","last_updated":"2025-03-10T12:34:24Z","snapshot_observed_at":"2026-08-06T23:39:09.398813Z","submitted_at":"2024-06-28T17:38:18Z","title":"EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.20076","snapshot_observed_at":"2026-07-14T04:38:05.237334Z","title":"arXiv preprint arXiv:2406.20076 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11581","last_updated":"2026-07-13T14:00:57Z","snapshot_observed_at":"2026-08-06T16:55:31.542502Z","submitted_at":"2026-07-13T14:00:57Z","title":"Actor as Its Own Critic: Unifying Region Understanding and Localization via CycleGRPO","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-07-14T04:38:05.237334Z"},"links":{"cited_paper":"/paper/2406.20076","citing_paper":"/paper/2607.11581"},"observation_digest":"sha256:cedcfba82946aca00d5f1cb25b2ee7d28639cbae369dc8ec7dbf2b8f0ece2e15","observation_id":"843ff5ba-65e2-4102-a554-a43190bc32e3","resolution":{"observed_at":"2026-07-14T04:38:05.237334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20076","last_updated":"2025-03-10T12:34:24Z","snapshot_observed_at":"2026-08-06T23:39:09.398813Z","submitted_at":"2024-06-28T17:38:18Z","title":"EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.20076","snapshot_observed_at":"2026-08-06T00:48:46.730648Z","title":"arXiv preprint arXiv:2406.20076 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03147","last_updated":"2026-08-05T06:08:54Z","snapshot_observed_at":"2026-08-08T23:10:46.664864Z","submitted_at":"2026-08-04T05:24:05Z","title":"CROSS: Cascaded Distillation and Dual-Constraint Grounding for Remote Sensing Referring Segmentation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T00:48:46.730648Z"},"links":{"cited_paper":"/paper/2406.20076","citing_paper":"/paper/2608.03147"},"observation_digest":"sha256:af309a7a3b0c091fe04d8896ea31d26a824b7927d6ec553b1a15fd08abf3efcb","observation_id":"77b526f0-3e14-49f8-a679-e6cd4bd18095","resolution":{"observed_at":"2026-08-06T00:48:46.730648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20076","last_updated":"2025-03-10T12:34:24Z","snapshot_observed_at":"2026-08-06T23:39:09.398813Z","submitted_at":"2024-06-28T17:38:18Z","title":"EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.20076","snapshot_observed_at":"2026-08-08T00:49:55.197773Z","title":"arXiv preprint arXiv:2406.20076 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03147","last_updated":"2026-08-05T06:08:54Z","snapshot_observed_at":"2026-08-08T23:10:46.664864Z","submitted_at":"2026-08-04T05:24:05Z","title":"CROSS: Cascaded Distillation and Dual-Constraint Grounding for Remote Sensing Referring Segmentation","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-08T00:49:55.197773Z"},"links":{"cited_paper":"/paper/2406.20076","citing_paper":"/paper/2608.03147"},"observation_digest":"sha256:10b65ea1f748598368052caf0169312fcb85c01d12dba9a66bf34d996ad80767","observation_id":"2b8b53ac-3859-4730-91a6-9c76df07f9e2","resolution":{"observed_at":"2026-08-08T00:49:55.197773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.20076/citation-record","integrity":"/paper/2406.20076/integrity","json":"/paper/2406.20076/citation-record.json","paper":"/paper/2406.20076"},"outbound":[],"paper":{"arxiv_id":"2406.20076","last_updated":"2025-03-10T12:34:24Z","latest_version":5,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T23:39:09.398813Z","submitted_at":"2024-06-28T17:38:18Z","title":"EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 20 inbound Pith citation observations for arXiv:2406.20076."}