{"as_of":"2026-08-11T01:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9b27fd6f867a32a8c26d3ddc3752611ba356624c1d6d3073104b1bb8dec7ed66","coverage":[{"denominator":86,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":86,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:42:45.538411Z","state":"measured"},{"denominator":86,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":86,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.17994/citation-record","integrity":"/paper/2505.17994/integrity","json":"/paper/2505.17994/citation-record.json","paper":"/paper/2505.17994"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:39.473748Z","title":"L., and Parikh, D","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:39.473748Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:ecf841be784bee5a37b3f7147fff43ebfd21c081aa81af509a71e24ecfc2e110","observation_id":"164c07b1-7686-4efc-b874-32d516a45982","resolution":{"observed_at":"2026-08-07T14:42:39.473748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:39.528596Z","title":"Fast and inexpensive color image segmentation for interactive robots","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:39.528596Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:40eb9cfca05dc06be6bfeface147f6f7d05e2234c5a21fa17942f51563e44a4e","observation_id":"c46b9bcc-11bd-4caf-934f-f96e6921968d","resolution":{"observed_at":"2026-08-07T14:42:39.528596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13224","last_updated":"2023-06-21T12:35:16Z","snapshot_observed_at":"2026-08-07T09:31:28.957302Z","submitted_at":"2022-11-23T18:59:05Z","title":"Peekaboo: Text to Image Diffusion Models are Zero-Shot Segmentors","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13224","snapshot_observed_at":"2026-08-07T14:42:39.590303Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:39.590303Z"},"links":{"cited_paper":"/paper/2211.13224","citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:4079d99a845e5c3a84959e397bdde7fb0cf7ccff14d69c0423bf4c611764ace0","observation_id":"46202bfd-1a10-452a-90e5-0590aea08908","resolution":{"observed_at":"2026-08-07T14:42:39.590303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:39.643194Z","title":"J., Elliot, S., and Cakmak, M","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:39.643194Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:8eea4a9579febd437708a10745bdcd3b05fee9fa36650211af7422fcb06cf84d","observation_id":"f6ee7d9f-08e7-474c-95f3-9730ea7722c1","resolution":{"observed_at":"2026-08-07T14:42:39.643194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:39.727953Z","title":"F., and Chen, C.-S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:39.727953Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:572f09855373074b17ce9f47d2a6b0723ad8554c79befbb68ab2b35207d0bccb","observation_id":"0d125d09-e92e-4635-b20a-e5f93f073294","resolution":{"observed_at":"2026-08-07T14:42:39.727953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:39.793255Z","title":"E., Stoica, I., and Xing, E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:39.793255Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:82ce3761edec3d03c09ff0233fed79a344a2020c9bf34bcf118d80bf21fc58b0","observation_id":"36437f81-cb89-4973-8e70-cfb65aa6ef2a","resolution":{"observed_at":"2026-08-07T14:42:39.793255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:39.857085Z","title":"The cityscapes dataset for semantic urban scene understanding","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:39.857085Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:4e328ce75b797195e5cf617900d93d0cdb263bf730bb635fc91a56b72501ba0b","observation_id":"fae14050-a333-45e2-999f-e7c6829f9772","resolution":{"observed_at":"2026-08-07T14:42:39.857085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-07T14:42:39.930499Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:39.930499Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:fb79b440bd879eb995153441b1e0796a3acc1b765a86e0fbbf752a6b285fff68","observation_id":"6b18a60c-32cc-4549-8b46-6fdd43722770","resolution":{"observed_at":"2026-08-07T14:42:39.930499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:56.254765Z","title":"Vision-language transformer and query generation for referring segmentation","venue":null,"work_id":"4ac303ec-5e40-4227-86ee-8b3ea4cff5ff","year":2021},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:40.022270Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:b7e953b987fca44c20d8a8dafa30392b0fb7ba14b898ccdca5b67b465cd03cca","observation_id":"694e7551-b4d1-4d85-b8d8-6c47506e68ac","resolution":{"observed_at":"2026-08-07T14:42:56.306706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:56.029743Z","title":"G., R \\\"u ckl \\'e , A., Lee, J.-U., Schulz, C., Mesgar, M., Swarnkar, K., Simpson, E., and Gurevych, I","venue":null,"work_id":"d2dbb9ce-f0ae-423e-a513-5f9451e2f891","year":2019},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:40.115275Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:fb55c12f6349f0bf2a6e33e79aea45e7f6549c0600baabbf9342a3e46c8a0d09","observation_id":"57be3e30-a2c5-487d-960d-37bbf40365a5","resolution":{"observed_at":"2026-08-07T14:42:56.164615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01618","last_updated":"2022-08-02T17:50:36Z","snapshot_observed_at":"2026-08-02T23:40:32.342515Z","submitted_at":"2022-08-02T17:50:36Z","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01618","snapshot_observed_at":"2026-08-07T14:42:40.167050Z","title":"H., Chechik, G., and Cohen-Or, D","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:40.167050Z"},"links":{"cited_paper":"/paper/2208.01618","citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:a118da0fd8a79a02f8aed4bbde1b32921671414c95b5790395c5d80aa80fe2b2","observation_id":"1670ad9f-3429-470a-9b57-3ff3751a89aa","resolution":{"observed_at":"2026-08-07T14:42:40.167050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:55.793084Z","title":"Vision meets robotics: The kitti dataset","venue":null,"work_id":"a66b25cb-d759-46da-bd44-f1c1471886c4","year":2013},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:40.225439Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:2a273a4c286502885d3d4e047b5086c08bf1e95d0f65b48dee2fcaefbc3c3acc","observation_id":"02a63f5e-0f78-4b59-a75a-f11ea676da2b","resolution":{"observed_at":"2026-08-07T14:42:55.920871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:40.283262Z","title":"Mask r-cnn","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:40.283262Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:857e0fbaf375fb1b2b01b2fefb0b32845151b69a471bcb10f6d67ee8a5100732","observation_id":"f3e80f7c-6a19-42bd-9155-251bd31dbed0","resolution":{"observed_at":"2026-08-07T14:42:40.283262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:55.629789Z","title":"Prompt-to-prompt image editing with cross-attention control","venue":null,"work_id":"8ead1d9c-3571-4b57-8803-58c6cb9ad9e8","year":2023},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:40.339676Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:6455c8b0c6b2ec9756ded76713c31dae528298adeb0400c6403776608cf8f68a","observation_id":"c38b6826-a6d3-490a-b109-9f40d85b7808","resolution":{"observed_at":"2026-08-07T14:42:55.694641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:40.390103Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:40.390103Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:aab9e68149ed7de4344b0618c77842ced57116bea6e52590c855e92e8f476ef4","observation_id":"d570fb94-273e-4d45-9ac5-6644b102c7b2","resolution":{"observed_at":"2026-08-07T14:42:40.390103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:55.420611Z","title":null,"venue":null,"work_id":"f02f69b5-705d-4a41-884a-0704984675af","year":2024},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:40.444013Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:c566c53fc6403df443b0d6979e9f075a2b3ff1bd5e9b3e7f203db29154e835cc","observation_id":"d4dbe620-9632-49e4-84db-df57166f7ade","resolution":{"observed_at":"2026-08-07T14:42:55.531201Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:55.257576Z","title":"Locate then segment: A strong pipeline for referring image segmentation","venue":null,"work_id":"9dbca1fc-faea-4d4a-9db0-cbd915661d25","year":2021},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:40.494972Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:709f2cb54e9fdfbd954517d446b498ddf15a5a4fa772e9839c3a113b3a35dea0","observation_id":"986e3372-5e18-4a66-82eb-6e2d161a667c","resolution":{"observed_at":"2026-08-07T14:42:55.294699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:55.123425Z","title":"Pnp inversion: Boosting diffusion-based editing with 3 lines of code","venue":null,"work_id":"78d909b6-2f0c-4630-9f2a-aaf3506914e4","year":2024},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:40.599694Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:501ca19b75bf3496c05c392161032eff7b71e1a77d0fb6a95ace407bc53e8f2c","observation_id":"d0ff2736-7c77-4746-bd66-97904f57ccda","resolution":{"observed_at":"2026-08-07T14:42:55.197011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09316","last_updated":"2024-09-30T03:17:39Z","snapshot_observed_at":"2026-08-10T21:35:35.307242Z","submitted_at":"2023-06-15T17:51:28Z","title":"Diffusion Models for Open-Vocabulary Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09316","snapshot_observed_at":"2026-08-07T14:42:40.659064Z","title":"Diffusion models for open-vocabulary segmentation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:40.659064Z"},"links":{"cited_paper":"/paper/2306.09316","citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:d9e344f13b18ba879863f4661e6e85053f13f59e0f4fa28b42e0b69bf29b2498","observation_id":"0da827f4-c3ba-4553-acbe-b05f1bb222dd","resolution":{"observed_at":"2026-08-07T14:42:40.659064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:54.964212Z","title":"Diffusion models for open-vocabulary segmentation","venue":null,"work_id":"016240d1-59bf-4903-a6f5-6ba583c8e785","year":2025},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:40.714495Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:1d5a3bed84c26290e085b59ea1403ec259c19c7398f1bf51fa9a44233bc14cc1","observation_id":"4f3de432-c336-4158-8e3c-92a97f196b04","resolution":{"observed_at":"2026-08-07T14:42:55.032248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:40.765332Z","title":"Referitgame: Referring to objects in photographs of natural scenes","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:40.765332Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:571bdcd576cf7a88dfbb89f35ba865696838c6e89877c39a36f5d52bd9c5b9a4","observation_id":"80c90ae7-c056-4d36-a147-1b634c0fbe17","resolution":{"observed_at":"2026-08-07T14:42:40.765332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:54.757597Z","title":null,"venue":null,"work_id":"37f83105-8a92-4ce3-bd27-5680513fbdcf","year":2019},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:40.809534Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:e9a6ab21282810aa633f4aa503e0657a63c7db10a30f9aff495d4aac4273f9a8","observation_id":"22ff80f0-d67a-4d15-9250-a7018cd9628b","resolution":{"observed_at":"2026-08-07T14:42:54.827576Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:40.892951Z","title":"C., Lo, W.-Y., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:40.892951Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:dd87caa707085914ad911b71ba9e330c99c9bde09d53759911dd0a9a6574c3c9","observation_id":"e11f0e4c-4f01-434b-b634-2af06771f681","resolution":{"observed_at":"2026-08-07T14:42:40.892951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:54.574440Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":"1a5db247-562c-41dd-bdbb-b7f6544d9ab0","year":2024},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:40.980937Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:89800c4155c8d19330a372f22c12485fec54e85a1f82972df1f022878767da7b","observation_id":"8475f94c-c1ee-446a-bb38-4cfac8cae99c","resolution":{"observed_at":"2026-08-07T14:42:54.641212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:54.381940Z","title":"Cryptext: Database and interactive toolkit of human-written text perturbations in the wild","venue":null,"work_id":"ab66408d-6f71-41ce-acb5-e29b92aa8649","year":2023},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:41.044578Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:d56227f7ca44b2ffa57ddef507940195f823d9dcca5e0003116a71cd81186a76","observation_id":"a49972b3-8d1c-4b99-a338-37359a2552cc","resolution":{"observed_at":"2026-08-07T14:42:54.480493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:41.145610Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:41.145610Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:6d8219ad1dbad0916d75b2c054c5770868f3e0bc23f9f18d213ad2cf5dce9ace","observation_id":"972299a0-ed18-497b-89b0-be3c7b835187","resolution":{"observed_at":"2026-08-07T14:42:41.145610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05963","last_updated":"2024-10-08T12:15:08Z","snapshot_observed_at":"2026-07-06T19:29:42.190813Z","submitted_at":"2024-10-08T12:15:08Z","title":"Training-Free Open-Ended Object Detection and Segmentation via Attention as Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05963","snapshot_observed_at":"2026-08-07T14:42:41.206735Z","title":"Training-free open-ended object detection and segmentation via attention as prompts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:41.206735Z"},"links":{"cited_paper":"/paper/2410.05963","citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:49acb940326624e1d544ff7746484b0c75883ff9c0a9de34a4c9696d5b226ddf","observation_id":"3cf8b8dc-d271-4fc8-850d-4bd41317c138","resolution":{"observed_at":"2026-08-07T14:42:41.206735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:54.152154Z","title":"E., Setio, A","venue":null,"work_id":"b393e7e3-5069-4849-bafe-62fdee67889e","year":2017},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:41.267262Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:12afde3472e942389eddb41414333ad4f3be103fe4e43d8865767e064b86b0db","observation_id":"7518ac67-355f-4689-a22a-a61a9c585da1","resolution":{"observed_at":"2026-08-07T14:42:54.251149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:53.975454Z","title":"Gres: Generalized referring expression segmentation","venue":null,"work_id":"72995255-f64b-408c-be58-4a8ffaba1d00","year":2023},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:41.374603Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:7c8cdabe69557cbbc04f1d17eef0c80f04fe0e9dba4a9f089384590f9d66faba","observation_id":"c4109939-6268-492a-88d7-414efe5df704","resolution":{"observed_at":"2026-08-07T14:42:54.038825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:53.814278Z","title":"Deep learning for generic object detection: A survey","venue":null,"work_id":"189ab179-6aa8-46f8-8d7e-7d6c62a48716","year":2020},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:41.489213Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:462b815abea9787dd8d04c46931ca4b2f3c36388eb8570cf08b19073dd528012","observation_id":"3bf6c785-fcb3-4d53-95d1-4282daa41d7c","resolution":{"observed_at":"2026-08-07T14:42:53.871717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-07T14:42:41.572024Z","title":"Roberta: A robustly optimized bert pretraining approach","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:41.572024Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:1048b07556961b83ade79625bdcce814991560b4fbca36c67710d45bb92dc13e","observation_id":"10b715c3-fc37-4b71-a64d-7640aee9b4c8","resolution":{"observed_at":"2026-08-07T14:42:41.572024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:41.676531Z","title":"Fully convolutional networks for semantic segmentation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:41.676531Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:28a922a2f7495fc6312a2d17aa2f253ba5cd6c0ec0286ab230c214c90eebc191","observation_id":"652472c8-474b-4753-a1de-2a83e38ddedd","resolution":{"observed_at":"2026-08-07T14:42:41.676531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:41.769995Z","title":"H., Holynski, A., and Darrell, T","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:41.769995Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:ec45d88322b62f15042ec702128096671b70cc6ef6ddd9a69dab9d7d2d71e53b","observation_id":"75c040e2-a40d-4120-b799-833a34e38477","resolution":{"observed_at":"2026-08-07T14:42:41.769995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:53.673501Z","title":"Segclip: Patch aggregation with learnable centers for open-vocabulary semantic segmentation","venue":null,"work_id":"c3314063-3499-42c8-b5d1-2367485a095c","year":2023},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:41.846602Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:51fbb4e9f57bf8bf773fef3a0bbd809c2f2c1f41d99469b2d94df88c360b6bbe","observation_id":"7bb6db2a-5bac-41a0-b096-2584fc55ce72","resolution":{"observed_at":"2026-08-07T14:42:53.715166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:41.917107Z","title":"L., and Murphy, K","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:41.917107Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:545e4e5a1936d776f855854f5d42f63c06ac3f8bd0e647f194a0386e5413e51b","observation_id":"b1c80291-5dbe-45f2-a43f-69a408a8cb96","resolution":{"observed_at":"2026-08-07T14:42:41.917107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:53.448106Z","title":"C., and Mart \\' nez, J","venue":null,"work_id":"fab79de0-47d8-412f-9b17-5e20d21b2ff2","year":2024},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:42.042817Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:0a6c83c6ed892b3676db1748e2290e4117cd1e7edbdd559d5ba16d6c24ae3a62","observation_id":"ddba789e-c2af-432c-90ff-912ec9d70b5e","resolution":{"observed_at":"2026-08-07T14:42:53.576038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03558","last_updated":"2024-10-18T06:19:45Z","snapshot_observed_at":"2026-07-06T19:27:47.617823Z","submitted_at":"2024-10-04T16:05:14Z","title":"Not All Diffusion Model Activations Have Been Evaluated as Discriminative Features","version":3},"cited_work":{"arxiv_id":"2410.03558","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.03558","snapshot_observed_at":"2026-08-07T14:42:45.780966Z","title":"Not All Diffusion Model Activations Have Been Evaluated as Discriminative Features","venue":"cs.CV","work_id":"0a324252-2909-4ec7-aff1-cc4e0e32ed64","year":2024},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:42.127527Z"},"links":{"cited_paper":"/paper/2410.03558","citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:90e4a80e61b00f3e6d3c06942266443e2143a7d23bf41d7943ccd463f64b36ff","observation_id":"99d6cad1-547a-4009-a95a-dbed58273c84","resolution":{"observed_at":"2026-08-07T14:42:45.817936Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:53.293099Z","title":"H., Jakab, A., Bauer, S., Kalpathy-Cramer, J., Farahani, K., Kirby, J., Burren, Y., Porz, N., Slotboom, J., Wiest, R., et al","venue":null,"work_id":"8501d340-fd64-4326-9abc-e2b65c588e36","year":1993},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:42.170101Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:52be85410746cae55358d8af26956c77fce4b2115bcea7967bbe318f5c7bc666","observation_id":"732022ec-8dd5-4eb5-a517-0c998bfde6dc","resolution":{"observed_at":"2026-08-07T14:42:53.371621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:53.074408Z","title":"Null-text inversion for editing real images using guided diffusion models","venue":null,"work_id":"f0337f71-e310-4780-81c8-883fabae2a00","year":2023},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:42.213515Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:97d273da8853c73d68fee9e6285517c70384c7530053d29939ddebaf2e7fd0fd","observation_id":"f5665f67-fa0a-4396-8850-0af178c317fa","resolution":{"observed_at":"2026-08-07T14:42:53.188844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:52.811090Z","title":"The role of context for object detection and semantic segmentation in the wild","venue":null,"work_id":"8ac95354-4623-49b9-b370-e14b4da6a414","year":2014},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:42.286728Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:4677b3df249dd8131b9f5bdfd7a39438afbdf6cef573404fcd68947ee66ec26f","observation_id":"a6f7d098-f03c-46d1-8ed8-dbd091166ff2","resolution":{"observed_at":"2026-08-07T14:42:52.918611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:52.570762Z","title":"H., and Lim, S.-N","venue":null,"work_id":"6e046e17-8222-44ad-9742-a382df5d9615","year":2023},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:42.370688Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:b07fcd9d36aa2159183ddb668fdab3b7276ef4c2a2312b1fa95cf5350992794c","observation_id":"5c0e4a78-6ffe-44ea-be4f-ac682f204e4a","resolution":{"observed_at":"2026-08-07T14:42:52.684884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11739","last_updated":"2024-01-22T07:34:06Z","snapshot_observed_at":"2026-08-05T19:36:32.752147Z","submitted_at":"2024-01-22T07:34:06Z","title":"EmerDiff: Emerging Pixel-level Semantic Knowledge in Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11739","snapshot_observed_at":"2026-08-07T14:42:42.441414Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:42.441414Z"},"links":{"cited_paper":"/paper/2401.11739","citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:6e1d78001b24958907a94e10f512162e0f939c8264e5fd7ecf1fe79cd9782ca3","observation_id":"26be77f2-4555-4a91-8b5e-162e1aac3179","resolution":{"observed_at":"2026-08-07T14:42:42.441414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:52.377734Z","title":"Localizing object-level shape variations with text-to-image diffusion models","venue":null,"work_id":"c75d7453-298e-4b13-b24e-5ddd70839bb4","year":2023},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:42.535552Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:84725f5ab3d0703b5d1da456a5403ed0f2ad48937442a9623fed0cc81dc0507f","observation_id":"ed39a8f4-a974-4d1a-8cdd-6839da7897e4","resolution":{"observed_at":"2026-08-07T14:42:52.467562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-07T14:42:42.614955Z","title":"Kosmos-2: Grounding multimodal large language models to the world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:42.614955Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:905a9c901f6315a58bba06b902a684848bce6a5a973f156483f1a8029f6d5403","observation_id":"3c73a9a2-46ef-4ad0-b05f-16ebfec2fa1c","resolution":{"observed_at":"2026-08-07T14:42:42.614955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:42.665627Z","title":"A., Wang, L., Cervantes, C","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:42.665627Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:4fb0de7a39f05c898c5e6b627e40d57ca78e72dbb3e09a4ed79a8298b08dd821","observation_id":"12dfb219-b998-4c26-9bf3-1959d104680a","resolution":{"observed_at":"2026-08-07T14:42:42.665627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:42.732874Z","title":"Improving language understanding by generative pre-training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:42.732874Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:f672c7234dd8097e8545a9b269ce959b04d6e37369513947c4ce215fc78da3be","observation_id":"327b48aa-b249-46c9-a074-2a7ea40a6544","resolution":{"observed_at":"2026-08-07T14:42:42.732874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:42.794882Z","title":"W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:42.794882Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:75db3d0d066d13acf5f8de2bb5059b4fc076e5308e42ef57dcf8e1f29b1afb96","observation_id":"8c4bfaa4-c64e-48ba-9ef7-b4af63ce6901","resolution":{"observed_at":"2026-08-07T14:42:42.794882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:42.893085Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:42.893085Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:c47532e0cd4192e45cb8a0ed4c0998a704f404787e7873ba2b6f2705fe063756","observation_id":"9c15bbfc-e77f-4c7e-a2a4-594d01ce6b54","resolution":{"observed_at":"2026-08-07T14:42:42.893085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:52.093665Z","title":"Perceptual grouping in contrastive vision-language models","venue":null,"work_id":"e2a9da59-31f8-4862-9df9-e8cdf1519407","year":2023},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:42.961658Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:1919e885223717695cc64bb52926c15ff02f32c59b297daf0e674dd43766149b","observation_id":"83f09a2e-dc3e-4418-b394-03a5240541e2","resolution":{"observed_at":"2026-08-07T14:42:52.227729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:51.904549Z","title":"M., Xing, E., Yang, M.-H., and Khan, F","venue":null,"work_id":"15b37b92-a5ca-4aed-aef8-0a7740aad6d5","year":2024},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:43.016511Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:8ec9bc606a93e4c0d1607b807120ee32b8d265320c2b86eab459e988c9167792","observation_id":"ef8e8d9d-977d-47ea-b1cc-916ad2bd0354","resolution":{"observed_at":"2026-08-07T14:42:52.003447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:51.688026Z","title":"Hyper- SD : Trajectory segmented consistency model for efficient image synthesis","venue":null,"work_id":"1ffc0050-249b-4928-9f0b-775635cd5367","year":2024},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:43.064964Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:fdfe7bd509af5593585054a594941637e0bdf43c9c53b05bedd5c10b558a6d56","observation_id":"92665210-4fa2-48f6-b1e4-acfd008d9cf3","resolution":{"observed_at":"2026-08-07T14:42:51.780387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:43.126072Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:43.126072Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:c3c453c761dc6c630e4c8b7fe4848cbcecc8012370c4dd149117475ae3890167","observation_id":"669b7824-35b5-41c8-88a6-c73e73a44c57","resolution":{"observed_at":"2026-08-07T14:42:43.126072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:43.217928Z","title":"U-net: Convolutional networks for biomedical image segmentation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:43.217928Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:118e3e561c3ae0d8d3fb6473cf667a726671a79241fe61458f3c5afa83abf58e","observation_id":"5567f5c1-07e2-40b4-bb02-0a708deed302","resolution":{"observed_at":"2026-08-07T14:42:43.217928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:51.454606Z","title":"Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation","venue":null,"work_id":"cc8fa352-ca6a-4c79-966a-b75d6b2abd97","year":2023},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:43.321633Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:04f9a71acc48b46c0d6c76959050c94cc8daa5656edcebc840792bc77e53557a","observation_id":"715af51c-56c7-4afd-9dd1-96fdde0a77c3","resolution":{"observed_at":"2026-08-07T14:42:51.562183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:43.365698Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:43.365698Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:5aa1c51af9f49ce1fc2834c90bedfad0a5de72004af9e54268e9308301c72ddd","observation_id":"187d319c-5ea0-44d9-bef1-9319e0740c68","resolution":{"observed_at":"2026-08-07T14:42:43.365698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:51.227159Z","title":"Revisiting unreasonable effectiveness of data in deep learning era","venue":null,"work_id":"64a5d08a-7fb0-4c9c-be61-a17c2ac22bbf","year":2017},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:43.424050Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:01ea3a472a9db55bc46b2fc904d19c14b4a2c35cdeb20b0246053c060bfa17d1","observation_id":"126315e7-b894-4077-968f-4ddb9d1b0a03","resolution":{"observed_at":"2026-08-07T14:42:51.322040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:50.981137Z","title":"Clip as rnn: Segment countless visual concepts without training endeavor","venue":null,"work_id":"98ff0f99-8489-4465-8df4-4d35defd49e7","year":2024},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:43.500488Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:3b27ec9ea3df60d608099b5ea696a9551e432a6195f37228cad68e1c9bebebdb","observation_id":"f94b6865-32d8-422c-b2ff-4f3cb44ccb6d","resolution":{"observed_at":"2026-08-07T14:42:51.086315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:50.776514Z","title":"What the daam: Interpreting stable diffusion using cross attention","venue":null,"work_id":"5d4f3f20-f777-483e-947c-77fec600a46e","year":2023},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:43.590174Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:b09add0b8449afdaf735fb501f608be10f0157c095aab23560042aad1364c426","observation_id":"a936b286-2469-4a74-90da-b68a44b5717e","resolution":{"observed_at":"2026-08-07T14:42:50.865025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:50.595297Z","title":"A., Friedland, G., Elizalde, B., Ni, K., Poland, D., Borth, D., and Li, L.-J","venue":null,"work_id":"6bc853d3-8aa2-44e5-adcf-735f16177710","year":2016},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:43.633606Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:e55c1738b656073dcae1351a69da80038caffe6367b9c23adc9c5bf4f911363b","observation_id":"00fb7408-ae2f-4af1-9234-c7cc1e423c90","resolution":{"observed_at":"2026-08-07T14:42:50.676009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12469","last_updated":"2024-04-02T17:40:03Z","snapshot_observed_at":"2026-08-10T14:10:13.836975Z","submitted_at":"2023-08-23T23:44:44Z","title":"Diffuse, Attend, and Segment: Unsupervised Zero-Shot Segmentation using Stable Diffusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12469","snapshot_observed_at":"2026-08-07T14:42:43.673904Z","title":"Diffuse, attend, and segment: Unsupervised zero-shot segmentation using stable diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:43.673904Z"},"links":{"cited_paper":"/paper/2308.12469","citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:fe28756a3d9e3a57d694c0e182cd9cdbed6d80a153665830c4945cadcc7b23ef","observation_id":"015164fc-2247-44b1-b426-123853792d9e","resolution":{"observed_at":"2026-08-07T14:42:43.673904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:50.399891Z","title":"Concept decomposition for visual exploration and inspiration","venue":null,"work_id":"59e2b461-4256-46ba-9d08-b56a7e163561","year":2023},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:43.734128Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:94adb0b90ec203e2849998890bffd14966570e2093ce7b4bedea480981c5839e","observation_id":"125694d8-5278-426b-9217-fdbe57efbde4","resolution":{"observed_at":"2026-08-07T14:42:50.494116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:50.172321Z","title":"Cris: Clip-driven referring image segmentation","venue":null,"work_id":"8fefc486-86f2-4607-9e96-9dd58535488b","year":2022},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:43.811411Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:ca441347e44f8738b405357c1a614d31c9708714b952c13c86c3beb33071f65f","observation_id":"657a6a79-0594-4e79-9b2f-d5e06e5bfd6f","resolution":{"observed_at":"2026-08-07T14:42:50.269955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:49.890939Z","title":"Towards open vocabulary learning: A survey","venue":null,"work_id":"24d16879-e542-4e72-b8de-0229deb1c049","year":2024},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:43.897631Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:cf6f567ee4ead7eecb23e71536d65c1b3327712a453b7e5bf3c9b5c988c78e9f","observation_id":"09f77ab3-b9ff-4a63-9f13-74f1297ee41a","resolution":{"observed_at":"2026-08-07T14:42:49.999158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:49.674347Z","title":"Gan inversion: A survey","venue":null,"work_id":"6a801ac0-b1a1-4113-a8df-0ae1db5ad797","year":2022},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:43.981766Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:6f439ddf549afecd0ac4277a5805c3f7e2cd07b2d1f42f3e470003657a00d704","observation_id":"e9716017-9122-4aec-9a40-2c3f0e0404de","resolution":{"observed_at":"2026-08-07T14:42:49.778516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:49.474848Z","title":"Gsva: Generalized segmentation via multimodal large language models","venue":null,"work_id":"41afffc0-4196-416c-bcc9-30be27357fd1","year":2024},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:44.079814Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:0c799839716e533feb9d34bde9989318c111be96561e75d2c81a19a3002ae8dc","observation_id":"85b34c55-ccb9-4d25-8965-e7c3b5a73ec5","resolution":{"observed_at":"2026-08-07T14:42:49.567596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:49.234406Z","title":"Groupvit: Semantic segmentation emerges from text supervision","venue":null,"work_id":"177365eb-dc35-4a87-9c79-39267853e184","year":2022},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:44.155740Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:0e286a57ddeaa0ca842867906e2e8b0435607d6cf4fa03e8385a19869e21fddb","observation_id":"5df82faf-f746-43e6-853f-1873e668f103","resolution":{"observed_at":"2026-08-07T14:42:49.330314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:48.987452Z","title":"Learning open-vocabulary semantic segmentation models from natural language supervision","venue":null,"work_id":"f7efd595-5eba-4769-a98b-d858360aa9ba","year":2023},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:44.229343Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:5da3649354945bdf4e8448f916a43801e0b0764c6d88afd84214290972f38c22","observation_id":"1e0304fd-1cf5-45bb-bd7b-59686629c9b6","resolution":{"observed_at":"2026-08-07T14:42:49.070645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:48.724541Z","title":"Open-vocabulary panoptic segmentation with text-to-image diffusion models","venue":null,"work_id":"1b783e2c-e3b4-4173-a90c-2bb229418db0","year":2023},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:44.287905Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:69889c5b32aac220d40422f13d4073b7b446da4c141142e9840313e750130491","observation_id":"5dfa4d5a-4639-44b4-b9ac-b9c3bd8eea03","resolution":{"observed_at":"2026-08-07T14:42:48.850069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:48.458631Z","title":"Bridging vision and language encoders: Parameter-efficient tuning for referring image segmentation","venue":null,"work_id":"7cafa706-0c40-4425-86a7-255d32ef03bd","year":2023},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:44.380614Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:75ea75ad966dd11d79732ba33aac4f620adcea7c3d711c5f06898a0ec3b2d053","observation_id":"38a957d1-add1-42ed-b6a6-fe1db5a1fae5","resolution":{"observed_at":"2026-08-07T14:42:48.554235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:48.283613Z","title":"Z., Guo, Z., Zhou, K., Zhang, W., and Liu, Z","venue":null,"work_id":"7265c25f-2a08-4e42-8c6b-dc1e296ecf11","year":2022},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:44.494698Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:57b4272883a998e283858b6f9d33cf0a5c7fdbd4ca4f5eeafe129419201e22da","observation_id":"3ac1dcbf-49d8-4a1e-8969-dd19384d2661","resolution":{"observed_at":"2026-08-07T14:42:48.367511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:48.035163Z","title":null,"venue":null,"work_id":"251a04b9-bff5-42a5-9f56-497812851c63","year":2022},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:44.556182Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:218ed80e25f4de9855851f4a1886df8b76d51b57aa8a69ff439c4520261a53db","observation_id":"cbe3e587-878e-4879-b140-918281b60404","resolution":{"observed_at":"2026-08-07T14:42:48.131992Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:47.832395Z","title":null,"venue":null,"work_id":"ad02c605-1f52-4b23-9a6a-9be34be0f815","year":2018},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:44.608866Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:9424933e8f53607716e784617e40cb88579d8b90172f69319413ddde3616ae21","observation_id":"8fb7ed89-0984-4c56-b5d8-9c6b0f84b6af","resolution":{"observed_at":"2026-08-07T14:42:47.916065Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:47.496371Z","title":"H., and Son, J","venue":null,"work_id":"7c79bd90-3cb5-41ad-a3b0-4dbd6ef76d2a","year":2023},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:44.661236Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:a2818249cf05fc316e274da3df0ce21099ce4416408f40bc19cbcf300ef2a578","observation_id":"2c3ab9f2-f223-49f7-8ff6-6280c5123617","resolution":{"observed_at":"2026-08-07T14:42:47.676038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19389","last_updated":"2024-10-01T06:07:24Z","snapshot_observed_at":"2026-07-06T18:38:05.229292Z","submitted_at":"2024-06-27T17:59:01Z","title":"OMG-LLaVA: Bridging Image-level, Object-level, Pixel-level Reasoning and Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19389","snapshot_observed_at":"2026-08-07T14:42:44.759272Z","title":"C., and Yan, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:44.759272Z"},"links":{"cited_paper":"/paper/2406.19389","citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:c85e5e0fe8b5df9591075d6f59030bae080a164c1a309261da3dfc9c1684275e","observation_id":"6e4587a7-680e-48c8-a5ee-96717b3c4406","resolution":{"observed_at":"2026-08-07T14:42:44.759272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:47.297631Z","title":"Psalm: Pixelwise segmentation with large multi-modal model","venue":null,"work_id":"bd5ff182-9f81-4681-ae6c-7dedaa56a229","year":2025},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:44.820967Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:c3a46c386b232c2ad8115284810fb2e6e5f28946cfb81ba3d3cfaa1b9236d8ee","observation_id":"87cf7b64-9d9d-4727-a4af-864edee51f22","resolution":{"observed_at":"2026-08-07T14:42:47.335621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:47.156786Z","title":"Unleashing text-to-image diffusion models for visual perception","venue":null,"work_id":"3354cb5c-0234-4459-8c74-91a7a2aa2f5a","year":2023},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:44.892483Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:cde9c3f42279dc83272d83311ccc09f424526f4e2e2bc126778e40325294c870","observation_id":"631c7900-249d-46af-8903-83abaf27ff11","resolution":{"observed_at":"2026-08-07T14:42:47.212319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08581","last_updated":"2023-07-17T15:51:47Z","snapshot_observed_at":"2026-08-10T13:18:06.198450Z","submitted_at":"2023-07-17T15:51:47Z","title":"BuboGPT: Enabling Visual Grounding in Multi-Modal LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08581","snapshot_observed_at":"2026-08-07T14:42:44.947498Z","title":"Bubogpt: Enabling visual grounding in multi-modal llms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:44.947498Z"},"links":{"cited_paper":"/paper/2307.08581","citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:c5eac1a4d5b9a4ee758c57389387c8a550ef3c00c9244a56dbca744d7f5f5373","observation_id":"d6a24a21-2330-46a2-a6a2-7f30727e9eed","resolution":{"observed_at":"2026-08-07T14:42:44.947498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:45.014331Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:45.014331Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:4d9ed7b5d317051d4d8fcc9b34a8ba808cc28b2a31ad73a4dd65bbdf1de65454","observation_id":"9feb6fb8-1c72-4972-acac-bccea5705f4d","resolution":{"observed_at":"2026-08-07T14:42:45.014331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:46.992440Z","title":"C., and Dai, B","venue":null,"work_id":"708d28e8-2b8e-4140-8585-f056f7d1c2d5","year":2022},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:45.061446Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:625629a08726cc77f59defb8778b162b41bfaa04090f709898d1f6620751ab40","observation_id":"6c99c8ed-1525-493e-82f8-3dead6bc0132","resolution":{"observed_at":"2026-08-07T14:42:47.068762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:46.788379Z","title":"C., and Dai, B","venue":null,"work_id":"078d2889-45f1-45ec-b36c-34edc4d78e13","year":2022},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:45.125565Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:f70a0362efab48f5a47a96b01c6199a0ba7199ad4c9daca5bf8a921e95caf6df","observation_id":"df42c6c8-b549-4b21-9cca-9374d28764a4","resolution":{"observed_at":"2026-08-07T14:42:46.860478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:46.625452Z","title":"C., and Liu, Z","venue":null,"work_id":"00aabb22-2e72-4e5f-bcee-ccfbc7a31af8","year":2022},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:45.187388Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:3be9f4f3cbac2c83a16cc131ab07a7763e9d372f634cbb912928f0195fb461dc","observation_id":"2d8bfd88-47f1-4e80-889c-85727f4b09c6","resolution":{"observed_at":"2026-08-07T14:42:46.695132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:46.481748Z","title":"C., and Liu, Z","venue":null,"work_id":"b8b326e6-8934-450c-803e-a95aef36d4ce","year":2022},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:45.252451Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:3dba1732f62d07fdacce8cc1150e68c96d0cbc89a4a7483260974c803f8f0092","observation_id":"48ae3b2c-802d-49a7-ad6d-7108f9116c85","resolution":{"observed_at":"2026-08-07T14:42:46.542312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12957","last_updated":"2024-11-27T09:54:05Z","snapshot_observed_at":"2026-08-05T03:56:09.380039Z","submitted_at":"2024-08-23T10:07:59Z","title":"Image Segmentation in Foundation Model Era: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12957","snapshot_observed_at":"2026-08-07T14:42:45.331969Z","title":"Image segmentation in foundation model era: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:45.331969Z"},"links":{"cited_paper":"/paper/2408.12957","citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:395dc98f748b2fa723aff4a5da5f63d91a4bf94d5e796e67a20e699fa5fe3d7d","observation_id":"e74b1880-523d-44e6-aedf-5380c4e18ad4","resolution":{"observed_at":"2026-08-07T14:42:45.331969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:46.327428Z","title":"and Chen, L","venue":null,"work_id":"2d2c47b9-5375-4421-aecb-5b7f0689438c","year":2024},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:45.394589Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:aa446362076b7793c292d5cd3fce030e6ec94f7ecea743af79ed145127e9440c","observation_id":"fcca3cbc-8479-41f9-a70f-7e40a4eb38db","resolution":{"observed_at":"2026-08-07T14:42:46.407328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:46.032861Z","title":"a henb \\","venue":null,"work_id":"68e4dded-794a-45c6-8333-6f6304c105d3","year":2016},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:45.459916Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:398393ecf977af26a6f12a759d25da78a5e5c41c52eb7dce8c08f6c02dc5d08c","observation_id":"decab247-a1a5-4141-a4a3-da2af3cbd595","resolution":{"observed_at":"2026-08-07T14:42:46.248821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:42:45.538411Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-07T14:42:45.538411Z"},"links":{"citing_paper":"/paper/2505.17994"},"observation_digest":"sha256:b0ae6dacb09383a9dbfd32b71a880d21b8606a1518858928c241224c48c80fc5","observation_id":"ae95435f-b83b-40ae-8401-b938f519fea6","resolution":{"observed_at":"2026-08-07T14:42:45.538411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.17994","last_updated":"2025-05-23T14:59:44Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T14:38:26.984734Z","submitted_at":"2025-05-23T14:59:44Z","title":"Segment Anyword: Mask Prompt Inversion for Open-Set Grounded Segmentation"},"reference_resolution":{"displayed":86,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":1,"verified_fuzzy":46},"total_outbound_references":86},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 86 of 86 outbound references and 0 inbound Pith citation observations for arXiv:2505.17994."}