{"as_of":"2026-08-18T07:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4280300c40c4c6bf248e3adf08a9575b423ae8c681d2c555bcec1f617dfba2f6","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:37:08.897852Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.23785/citation-record","integrity":"/paper/2506.23785/integrity","json":"/paper/2506.23785/citation-record.json","paper":"/paper/2506.23785"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:10.342650Z","title":"Lung image database consor- tium: developing a resource for the medical imaging research community","venue":null,"work_id":"fee7c3c3-54c1-4fa6-8ff5-d73b00be030a","year":2004},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:02.947288Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:4d8800815282e88bb9fc7c0273a6055ea2f5df588c9866a70ef378ac6b832caf","observation_id":"cf10745e-c8e4-4e84-81dc-bf97e68189d9","resolution":{"observed_at":"2026-08-06T21:37:10.347738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17274","last_updated":"2022-06-03T17:52:04Z","snapshot_observed_at":"2026-08-16T17:10:09.647539Z","submitted_at":"2022-03-31T17:59:30Z","title":"Exploring Visual Prompts for Adapting Large-Scale Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.17274","snapshot_observed_at":"2026-08-06T21:37:03.071096Z","title":"Exploring visual prompts for adapting large- scale models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:03.071096Z"},"links":{"cited_paper":"/paper/2203.17274","citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:be9c49574e242dfe8e85bf9d794c5a805870129baa08c1a7031bb2774fe72cae","observation_id":"a8a31ae4-53dd-4930-936c-bc8d7851bbba","resolution":{"observed_at":"2026-08-06T21:37:03.071096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:10.328065Z","title":"Fs-detr: Few-shot detection transformer with prompting and without re-training","venue":null,"work_id":"04455200-bf3b-43c0-9932-41481ee20b7e","year":2023},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:03.162281Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:0f401bf1ef168398261d9975332aff15d099eadf09a005ca74fdcabc134f25d8","observation_id":"494e3f34-7810-4fca-94fa-730bd867c9cc","resolution":{"observed_at":"2026-08-06T21:37:10.332668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:10.311960Z","title":"Apollo: Unified adapter and prompt learning for vision language models","venue":null,"work_id":"de09bd9f-2e70-4108-92bc-7ffd417108aa","year":2023},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:03.251458Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:c46189f53d0bfa89da2d73aa7f39154c15831fe63479c0fed08e6dc0d1efcf64","observation_id":"c10b563c-4060-489f-b9b8-d1a0a9c4ea95","resolution":{"observed_at":"2026-08-06T21:37:10.316861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:10.288388Z","title":"Coarse-to-fine vision-language pre-training with fusion in the backbone.NeurIPS, 35:32942–32956, 2022","venue":null,"work_id":"f8b0dd52-aeea-4334-ac9d-5b9c705ce11b","year":2022},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:03.345641Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:0b85fd5919dc42b2ab8d90ca70ecc8d0c67fd4000856831f8737e2b409ab8e87","observation_id":"f4129d0f-d7d2-41ab-ab60-dc6c1fc394c2","resolution":{"observed_at":"2026-08-06T21:37:10.299990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:10.270791Z","title":"s- adaptive decoupled prototype for few-shot object detection","venue":null,"work_id":"44ec8a51-1150-441e-ba3f-f6bcc76f8c8a","year":2023},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:03.421737Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:1c080958202c6eddf8c268942dfbafd8ef6a555ac7c82b7cc1515186b0bed91e","observation_id":"b47ad70b-726a-4417-8822-148ba1e39462","resolution":{"observed_at":"2026-08-06T21:37:10.276015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:10.251872Z","title":"Learning to prompt for open-vocabulary object detection with vision-language model","venue":null,"work_id":"ca00853d-eb5c-4c13-b1a0-2e9689757181","year":2022},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:03.502861Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:d4016eb1695bead89891e35cf7b86f4385ca39c021713414a30a004516b69a96","observation_id":"02332cf4-9657-440c-b52a-6f5b0fca1064","resolution":{"observed_at":"2026-08-06T21:37:10.258469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11982","last_updated":"2020-10-22T18:44:16Z","snapshot_observed_at":"2026-08-16T19:11:21.265490Z","submitted_at":"2020-10-22T18:44:16Z","title":"The Turking Test: Can Language Models Understand Instructions?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11982","snapshot_observed_at":"2026-08-06T21:37:03.644571Z","title":"The turking test: Can lan- guage models understand instructions? arXiv preprint arXiv:2010.11982, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:03.644571Z"},"links":{"cited_paper":"/paper/2010.11982","citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:175f3ce216e52e36ed509da0d38a63ba5f6fa5f3200564ab404de84a822f36f6","observation_id":"fc7a5f35-5371-4a1f-8b5f-125bf38d7737","resolution":{"observed_at":"2026-08-06T21:37:03.644571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:10.229027Z","title":"The pascal visual object classes (voc) challenge","venue":null,"work_id":"0cfd0f8d-67b4-4055-8eec-9207c727e048","year":2010},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:03.743469Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:9278e8eb687e0952bd0b2193adfa9095441937cff375b9a6fa8b7fd011240efe","observation_id":"5d4286b5-c630-43ea-91e4-2648e1275036","resolution":{"observed_at":"2026-08-06T21:37:10.235878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:03.829699Z","title":"Few- shot object detection with attention-rpn and multi-relation detector","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:03.829699Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:60e6549840652b03442a39041416eccec6ca6db095c107bfaa2e23a03e8a88f6","observation_id":"da991085-3e35-48f9-92af-c7c2e6ba7bef","resolution":{"observed_at":"2026-08-06T21:37:03.829699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:10.197197Z","title":"Nuclei grading of clear cell renal cell carcinoma in histopatho- logical image by composite high-resolution network","venue":null,"work_id":"5c47a089-9f76-44e4-9388-9cd29d08b164","year":null},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:03.904842Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:64d0fee37d80486917a55e8e3ee575b8fc217219a595749016e5628cfc239f3c","observation_id":"d5dc14cd-cb45-4eec-8789-e2f26e00a6e2","resolution":{"observed_at":"2026-08-06T21:37:10.205060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:10.178557Z","title":"Hover-net: Simultaneous segmentation and classification of nuclei in multi-tissue histology images","venue":null,"work_id":"b05db57a-15ea-477d-8c0a-fba9c08bd45b","year":2019},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:04.004247Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:b4f7c46c343b24e5e4c933d8ff9b665b03d0dd3ae736f0a8878db9d8da9e8f86","observation_id":"0c33a867-fc55-40ee-9428-acedea4ca5b9","resolution":{"observed_at":"2026-08-06T21:37:10.185000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.12980","last_updated":"2023-07-24T17:58:06Z","snapshot_observed_at":"2026-08-16T15:13:41.319424Z","submitted_at":"2023-07-24T17:58:06Z","title":"A Systematic Survey of Prompt Engineering on Vision-Language Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.12980","snapshot_observed_at":"2026-08-06T21:37:04.064646Z","title":"A systematic survey of prompt engineer- ing on vision-language foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:04.064646Z"},"links":{"cited_paper":"/paper/2307.12980","citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:ecb7618dc7143906b840fb72f8b24b69867fa6d4827e5344839b5ce6db330df8","observation_id":"482ae711-fa47-4911-ab40-5dd7c88d34a5","resolution":{"observed_at":"2026-08-06T21:37:04.064646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.13921","last_updated":"2022-05-12T01:27:40Z","snapshot_observed_at":"2026-08-16T03:57:01.951598Z","submitted_at":"2021-04-28T17:58:57Z","title":"Open-vocabulary Object Detection via Vision and Language Knowledge Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.13921","snapshot_observed_at":"2026-08-06T21:37:04.138434Z","title":"Open- vocabulary object detection via vision and language knowl- edge distillation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:04.138434Z"},"links":{"cited_paper":"/paper/2104.13921","citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:a9637bcb6488a162514b71d1ed9f5bc907b285a67a27918bbd8e8d141abe42df","observation_id":"966a79fa-1baa-48e3-bde5-e59e1b4c9e28","resolution":{"observed_at":"2026-08-06T21:37:04.138434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:10.162214Z","title":"Dp-ddcl: A discriminative prototype with dual decou- pled contrast learning method for few-shot object detection","venue":null,"work_id":"32bff2ac-83ba-4fb1-943e-a09e2f8168ac","year":2024},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:04.250057Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:f0de6140c82a51d56948585b292363cb5b92f2c726c180ef74ac00582851a67e","observation_id":"d248f254-2407-4685-a5a7-ce97d22d99b7","resolution":{"observed_at":"2026-08-06T21:37:10.166743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:10.144975Z","title":"Lvis: A dataset for large vocabulary instance segmentation","venue":null,"work_id":"a36c1438-1cf0-4c07-98ad-af5b6a70b0c4","year":2019},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:04.369673Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:d135ab5cab58b31317ebc9383e5a16f46c32cf8c6f65060fbf074cbcaf3ea952","observation_id":"2c1e0f48-be20-4d20-b198-254041fd36b0","resolution":{"observed_at":"2026-08-06T21:37:10.149088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:10.130635Z","title":"Few-shot object detection with foundation models","venue":null,"work_id":"a05cbf7b-1c7f-48fa-825d-222affd911e1","year":2024},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:04.489927Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:f1e16d0dc8a70025c33b1a67158b1b9d63b40fe283f89d577731f6a781975e4e","observation_id":"75988dd5-13ac-45a7-8487-7f4ad5410f54","resolution":{"observed_at":"2026-08-06T21:37:10.135836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:10.113753Z","title":"Query adaptive few-shot object detec- tion with heterogeneous graph convolutional networks","venue":null,"work_id":"cdc6b496-f9e5-4e82-820c-531e0e41336e","year":2021},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:04.567751Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:3540488db2dc009f22e7e2046d953bfc92c2c422897243737c676a10f0587fe7","observation_id":"e848ea3a-8a08-4488-8694-157cb8550f99","resolution":{"observed_at":"2026-08-06T21:37:10.119455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.07841","last_updated":"2023-03-27T15:40:57Z","snapshot_observed_at":"2026-08-16T17:06:33.409790Z","submitted_at":"2022-04-16T16:45:06Z","title":"Multi-Modal Few-Shot Object Detection with Meta-Learning-Based Cross-Modal Prompting","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.07841","snapshot_observed_at":"2026-08-06T21:37:04.660592Z","title":"Multi-modal few- shot object detection with meta-learning-based cross-modal prompting","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:04.660592Z"},"links":{"cited_paper":"/paper/2204.07841","citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:adb893185aaf166516df71c0bcbc296e09313bcce80772ed71f641cb116b1cd7","observation_id":"0eb56578-ed90-408c-b085-e6eee5a18312","resolution":{"observed_at":"2026-08-06T21:37:04.660592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:10.095775Z","title":"Meta faster r-cnn: Towards accurate few-shot object detection with attentive feature alignment","venue":null,"work_id":"2719919c-f281-4136-ae07-fcc854b9fe0c","year":2022},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:04.727426Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:895c9d21dee1ab958f249fff8fb8b817dafa24d95efb8867dab0a9086b459e1e","observation_id":"0b083cbe-5052-4226-b5da-d752dfbf10b3","resolution":{"observed_at":"2026-08-06T21:37:10.100727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:10.078981Z","title":"Few-shot object detection with fully cross- transformer","venue":null,"work_id":"b054ada2-b008-4b8d-9db7-92cb9de4bdc6","year":null},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:04.978030Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:86cce9844b5381c16b850da3ef042f185a59acce91c86e2e7ad3d63dfd6ad8c1","observation_id":"68627033-c1b9-4d89-9ce7-a487d2873efb","resolution":{"observed_at":"2026-08-06T21:37:10.084388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.941860Z","title":"Few-shot object detection via variational feature aggregation","venue":null,"work_id":"93bd5175-bfa9-4737-bb6f-838c42e48d97","year":2023},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:05.120058Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:ef0110a9389b6ee8fdc508c241282c47643230194f75853c731337142ba4cd85","observation_id":"a3f2ac37-d0a0-4ebb-8c91-099a6c3c8f29","resolution":{"observed_at":"2026-08-06T21:37:09.947853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.926279Z","title":"Visual prompt tuning","venue":null,"work_id":"c901d7f9-3ac6-443d-b343-b70aa1be6a4a","year":2022},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:05.202072Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:39b1f2cd5d6406c932c8a2ab8cfc8999b0d2f19bb8cd6146993861e17fd06e40","observation_id":"02f4ff15-dfd7-4c74-ba03-bcff5b1ea601","resolution":{"observed_at":"2026-08-06T21:37:09.931188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.906233Z","title":"Bert: Pre-training of deep bidirectional transform- ers for language understanding","venue":null,"work_id":"caebe143-d0af-4eea-8213-1d8a538cec5c","year":2019},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:05.307636Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:c631e045046c27dd185a94eed31e8d7cc41082bf7a35a08e25a2bfa5361f0b8c","observation_id":"d8e8e50f-2e4b-4c46-af8e-5097595a48d5","resolution":{"observed_at":"2026-08-06T21:37:09.913726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.887168Z","title":"Maple: Multi- modal prompt learning","venue":null,"work_id":"8c64ba52-2a7a-463f-84c3-da94565985b8","year":2023},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:05.404038Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:84db5188188e26a1579021c53d4b7bfcf2bc5df9efb358a2edd29c993f52bc13","observation_id":"8fb616bd-3570-45dc-8811-9f2bf38cb355","resolution":{"observed_at":"2026-08-06T21:37:09.891918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.867433Z","title":"A dataset and a technique for generalized nuclear segmentation for computa- tional pathology","venue":null,"work_id":"6b7e877d-3bd1-4dd5-842f-0b289cf8c7af","year":2017},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:05.530990Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:32023a37aaa378582253cd469146d3578c894b9a4fdfe75802bad5c6dcd46781","observation_id":"5b792927-2702-4896-8eec-86b34a410cca","resolution":{"observed_at":"2026-08-06T21:37:09.871760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15639","last_updated":"2023-02-23T19:14:52Z","snapshot_observed_at":"2026-08-16T16:27:46.006186Z","submitted_at":"2022-09-30T17:59:52Z","title":"F-VLM: Open-Vocabulary Object Detection upon Frozen Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15639","snapshot_observed_at":"2026-08-06T21:37:05.649074Z","title":"F-vlm: Open-vocabulary object detection upon frozen vision and language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:05.649074Z"},"links":{"cited_paper":"/paper/2209.15639","citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:ea9d81aee05ec5543e33b92f9764d842b53c14a75cd6f4fb433d07c873c025ea","observation_id":"d737176b-afa7-4a34-9af7-dd51e16057d7","resolution":{"observed_at":"2026-08-06T21:37:05.649074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.851536Z","title":"Elevater: A benchmark and toolkit for evaluating language-augmented visual models","venue":null,"work_id":"a3485c1a-b5a3-4034-a026-0f0531b5c299","year":null},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:05.790125Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:bef2cfa98a21ed218528898c687011391bbde31cbdab5f8b2a86cfeb757993f4","observation_id":"7be32b2c-81c1-47a8-b5ac-15dbca57af3b","resolution":{"observed_at":"2026-08-06T21:37:09.855850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.836663Z","title":"Disentangle and remerge: interventional knowledge distillation for few-shot object detection from a conditional causal perspective","venue":null,"work_id":"55db2b28-52b5-4e9b-822a-292b9028fcaa","year":2023},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:05.875694Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:ba9b48f39380c63739530176973f76e00faba43ea0aa2fc04307d9a84e4f75b4","observation_id":"002258a5-4867-4e66-936b-65487eb0445c","resolution":{"observed_at":"2026-08-06T21:37:09.841297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.816088Z","title":"Grounded language- image pre-training","venue":null,"work_id":"5003c47e-82c4-48cd-8aa4-bf9079515125","year":2022},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:05.969037Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:12c9303d585a2122dbbd379a9ea6d981299534ade1cb5256bbeb72329ff2b710","observation_id":"e4c5e956-6447-4a4a-9cc8-20fcf753f8c8","resolution":{"observed_at":"2026-08-06T21:37:09.820928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.782212Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"4fa041be-8510-4f55-a93a-bfee8c259052","year":2014},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:06.045211Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:52e154ad0e8eb781b1623dec30193b6126896a730315bb41d6d52ec6412ef121","observation_id":"9edc8e46-7db7-4c90-9e95-dd493c8605c8","resolution":{"observed_at":"2026-08-06T21:37:09.788346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-06T21:37:06.107791Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:06.107791Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:b05002c0060d60848b40cb20db74b0b5500614388a2d26939bd909c28b1e25d7","observation_id":"b2801c4e-e958-4df3-9fca-ba4b3f05eab5","resolution":{"observed_at":"2026-08-06T21:37:06.107791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:06.250780Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:06.250780Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:de8a9b26e5b320deef6d2cd309bf4c7f7ead581b6c41331068187b56cd70fb93","observation_id":"01277d58-5a56-4099-b94e-764c9deffc45","resolution":{"observed_at":"2026-08-06T21:37:06.250780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.751571Z","title":"Breaking immutable: Information-coupled prototype elaboration for few-shot ob- ject detection","venue":null,"work_id":"0a652512-09a1-4e46-8b14-de73760b3d1d","year":2023},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:06.324343Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:3290c011704037f3dd0351fd2d5eb44cd4f53868c8c7e03e88f67fa73ab685b2","observation_id":"739b0451-22e2-4f15-a6aa-48fd1e79a463","resolution":{"observed_at":"2026-08-06T21:37:09.756412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.731881Z","title":"Image segmentation us- ing text and image prompts","venue":null,"work_id":"a57b6221-74a3-4d2b-aa42-c86153a5c632","year":2022},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:06.388853Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:92087ad63aedf3ab3fa8a2d523941d0d0ff69f076f24a36493b504f1135ce649","observation_id":"c39a64d9-a64f-48d1-99da-e3a2469eb890","resolution":{"observed_at":"2026-08-06T21:37:09.737378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.716980Z","title":"Digeo: Discriminative geometry-aware learning for generalized few-shot object de- tection","venue":null,"work_id":"e400df1b-1f80-4038-9c8f-0ad59be60db5","year":null},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:06.440503Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:20f4295e00bbb59a20aef82d5592cd03e646f1e66da81edc7c4df212bc706cea","observation_id":"f0c2cc35-7f82-4ae8-af0e-e8d608ccaf31","resolution":{"observed_at":"2026-08-06T21:37:09.722011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.693968Z","title":"Simple open-vocabulary object detection","venue":null,"work_id":"769efc20-55d6-4ddc-a338-386cfa452d5a","year":2022},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:06.497243Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:8d09f5652727d9cf61ba632306ffad1b1a24f725d072ef7caf84d05df01999e5","observation_id":"5f89670f-611c-4991-91f4-bc0e8c45a54a","resolution":{"observed_at":"2026-08-06T21:37:09.701594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.671597Z","title":"Scal- ing open-vocabulary object detection","venue":null,"work_id":"fb170fec-0127-407e-a6ec-fe8dd3748a71","year":2023},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:06.557963Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:af4ae6129bfdda9c9dc17d09b60b7fd2c1f0f4f39352c5afff1efa7e6b355d17","observation_id":"e0af7dcd-d85c-45f1-b10d-0fdc4ff3770f","resolution":{"observed_at":"2026-08-06T21:37:09.678121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.654215Z","title":"Defrcn: Decoupled faster r-cnn for few-shot object detection","venue":null,"work_id":"15878a71-10e5-427d-94ee-b89aa181000d","year":2021},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:06.624223Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:e39e59dc52805dfd50dd36429f12f102f2cce3a8275d978486f4fbea5086f416","observation_id":"a907e535-54c4-4178-8f1b-7ead7169f35e","resolution":{"observed_at":"2026-08-06T21:37:09.659393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.630832Z","title":"Language models are unsuper- vised multitask learners","venue":null,"work_id":"9fa6c80d-cde2-4ed8-803b-8972f46c2453","year":2019},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:06.665207Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:b1e28ba50926a72aeda40ac1e1eeb5bff7f005cc826c5498cc68168eff0f8d06","observation_id":"60171d71-81d6-4b39-a81b-16cc0df5ae2a","resolution":{"observed_at":"2026-08-06T21:37:09.638175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.605568Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"e361eb4f-e013-4fe0-9e8f-0322fec7373b","year":2021},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:06.744231Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:eb0cba1780e3624ea95ee9cab0fdabbcf7e8ff99707428982544293458ed2b0b","observation_id":"3de2fc5b-5b78-44e4-a450-e5c16d79a758","resolution":{"observed_at":"2026-08-06T21:37:09.611623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.582101Z","title":"Adaptive multi-task learning for few-shot object detection","venue":null,"work_id":"c5dfd35c-97aa-46a3-9233-b7089573a858","year":null},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:06.869279Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:e6cab339aa9a9a540c35cbf9996baf3b2f788217cd9a4c5c96ec11b43efe4c4c","observation_id":"6157ef5e-b882-49eb-a9d0-f5d86407f505","resolution":{"observed_at":"2026-08-06T21:37:09.588564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:06.980275Z","title":"Objects365: A large-scale, high-quality dataset for object detection","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:06.980275Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:edbce4dd83b7dd8594b419138acb323c26562ac6ec2764a91c2ca5a40ea04a06","observation_id":"9042d0fc-ffe6-4c22-afa7-39b41f8cacbf","resolution":{"observed_at":"2026-08-06T21:37:06.980275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.546151Z","title":"Few- shot adaptive faster r-cnn","venue":null,"work_id":"fa895125-e6d5-49c8-83dd-0998aa580227","year":2019},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:07.045297Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:1e0e7bc64abc87309c4347106cab9518bdb196576c5a7692732706666f1789bf","observation_id":"9b62f9e8-eb53-4952-bd87-25f58b822722","resolution":{"observed_at":"2026-08-06T21:37:09.551444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.06957","last_updated":"2020-03-16T00:29:14Z","snapshot_observed_at":"2026-08-17T06:23:20.594040Z","submitted_at":"2020-03-16T00:29:14Z","title":"Frustratingly Simple Few-Shot Object Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.06957","snapshot_observed_at":"2026-08-06T21:37:07.148413Z","title":"Frustratingly simple few-shot object detection","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:07.148413Z"},"links":{"cited_paper":"/paper/2003.06957","citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:d79629c32e8b6538116ed86a6c37e0bfcf8e456f0a823e96d6415489faa26306","observation_id":"86f89577-7cb6-453c-810b-285054f4d9b3","resolution":{"observed_at":"2026-08-06T21:37:07.148413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.526165Z","title":"Snida: Unlocking few-shot object detection with non- linear semantic decoupling augmentation","venue":null,"work_id":"522bd30c-ad35-437c-9b44-d33188767d26","year":2024},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:07.207653Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:7ec83aff89b7a5161a1ee1924b97956756fb1672205921625a42a1826a1e6187","observation_id":"3e24ebcb-cddf-4047-90bd-acd227207b64","resolution":{"observed_at":"2026-08-06T21:37:09.530773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.511808Z","title":"Multi- scale positive sample refinement for few-shot object detection","venue":null,"work_id":"5318281f-d7a7-4bf2-8121-199fc8e97e5a","year":2020},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:07.267887Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:f3d280c80452d9723f5ebfe0f774d46bf6c7120837d54455cbcb1e55d5639e1e","observation_id":"dfa01c67-5c5f-4333-b46e-b41aa717ed20","resolution":{"observed_at":"2026-08-06T21:37:09.516661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.496456Z","title":"Multi-faceted distillation of base-novel commonality for few-shot object detection","venue":null,"work_id":"54fab45d-16f3-488c-a9c5-9b4fba2dc308","year":2022},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:07.331054Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:1094a0aee8ec1033a5ba3552b0239f13d0321a6e82d7d5c12359a8874fd98ee8","observation_id":"c7e19578-69fe-445c-abf4-20e2d9dc6474","resolution":{"observed_at":"2026-08-06T21:37:09.501311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.480358Z","title":"Cora: Adapting clip for open-vocabulary detection with region prompting and anchor pre-matching","venue":null,"work_id":"958d9db0-beb5-41ca-adf1-1ab161cc5591","year":2023},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:07.456827Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:2ede60a1941ca7fce6c523285a99156208d1ba783ff458bb693dabb78fdd21a4","observation_id":"1767531d-f860-461e-b608-09d2122bdc64","resolution":{"observed_at":"2026-08-06T21:37:09.485161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.465225Z","title":"Generating fea- tures with increased crop-related diversity for few-shot ob- ject detection","venue":null,"work_id":"b9fa5e28-f263-434c-93d5-f83ca8167e32","year":2023},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:07.524136Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:2fae19bb9239343680652d1aa0aff83f1bbb66a98ccd3d1e1d7d2e7d8349539e","observation_id":"2feb1fc3-d790-4a12-aaf4-a92cecd2fceb","resolution":{"observed_at":"2026-08-06T21:37:09.469861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.449840Z","title":"Multi-modal queried object detection in the wild","venue":null,"work_id":"014f394a-d856-4ee6-abc3-d0ab02a8f908","year":2023},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:07.577668Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:c0fdd8398a94917f80f2cf77b2cd9e5f312347aca40f4a316bd30265fe826cde","observation_id":"a057a633-5693-40a9-82c8-13bf30038f4f","resolution":{"observed_at":"2026-08-06T21:37:09.454659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.01766","last_updated":"2017-10-10T17:49:41Z","snapshot_observed_at":"2026-08-16T18:36:41.157327Z","submitted_at":"2017-10-04T19:10:38Z","title":"DeepLesion: Automated Deep Mining, Categorization and Detection of Significant Radiology Image Findings using Large-Scale Clinical Lesion Annotations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.01766","snapshot_observed_at":"2026-08-06T21:37:07.600258Z","title":"Deeplesion: Automated deep mining, categorization and detection of significant radiology image findings us- ing large-scale clinical lesion annotations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:07.600258Z"},"links":{"cited_paper":"/paper/1710.01766","citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:c285474d621aedc046a8f7c36982c780f0f7ec6d9806195e3b2ffeda33686be7","observation_id":"0c0f5449-7811-4090-ba43-158692c4fef9","resolution":{"observed_at":"2026-08-06T21:37:07.600258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.431513Z","title":"Meta r-cnn: Towards general solver for instance-level low-shot learning","venue":null,"work_id":"90e952e2-4b32-489f-9f28-6b3c9d5acc06","year":2019},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:07.694527Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:cf6102d2017722aea15a7dad591009525d1861a689a7447a319ea5cd7b1e6951","observation_id":"73132bc0-6d32-4dd3-b3f0-56030f5c197d","resolution":{"observed_at":"2026-08-06T21:37:09.438524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.416564Z","title":"Meta-detr: Image-level few-shot detection with inter-class correlation exploitation","venue":null,"work_id":"7d2bafa8-cce0-452c-a848-8e82ea0e4166","year":null},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:07.849351Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:612cb7ea2243913c645c1e88259900abd039825c6bc223a5908bb3516e75e33d","observation_id":"e0e62d53-abc9-42a2-90d8-3c4e5d8d3c68","resolution":{"observed_at":"2026-08-06T21:37:09.421162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.12969","last_updated":"2024-10-02T19:26:18Z","snapshot_observed_at":"2026-08-16T14:58:23.290186Z","submitted_at":"2023-09-22T16:07:16Z","title":"Detect Everything with Few Examples","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.12969","snapshot_observed_at":"2026-08-06T21:37:08.017364Z","title":"Detect every thing with few examples","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:08.017364Z"},"links":{"cited_paper":"/paper/2309.12969","citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:6a173eb68d730badaee03a78098318d5f2446e763b2552a1cd33a7753286df80","observation_id":"e6ad7f42-c487-4313-b2c1-295f968ec37e","resolution":{"observed_at":"2026-08-06T21:37:08.017364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.393189Z","title":"Vlm-guided explicit-implicit complementary novel class semantic learning for few-shot object detection","venue":null,"work_id":"2a7fb715-1a3b-4c09-ab54-b70f54c9b0eb","year":2024},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:08.184430Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:49762b5160b45cbb00801a1095be618b7c2ea80b5ffe80f03aa3342bb4ea5211","observation_id":"42ad3728-b973-43cf-af2f-2cb443f79a27","resolution":{"observed_at":"2026-08-06T21:37:09.399983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.372264Z","title":"Scene-adaptive and region-aware multi-modal prompt for open vocabulary object detection","venue":null,"work_id":"e4404662-2a33-4276-ac04-56c97743ce6b","year":2024},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:08.351578Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:ec4c3d0ee9e07ddb58430128ab79da8cb7962b5a2d8cb2bcc19ef3b38d9e6a0f","observation_id":"a5d45fcf-aa5b-47a6-8f2a-2ad0baa3c275","resolution":{"observed_at":"2026-08-06T21:37:09.377603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.348423Z","title":"Regionclip: Region-based language-image pretraining","venue":null,"work_id":"7ada1497-1ab4-4299-b8cb-686d80be9395","year":2022},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:08.516525Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:86ad57de9545d86f4cae852b27525978b25f35e23099d2cad4093fb7762a37d8","observation_id":"08905e76-b956-41e3-930d-b50160e36131","resolution":{"observed_at":"2026-08-06T21:37:09.355023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.332016Z","title":"Conditional prompt learning for vision-language models","venue":null,"work_id":"e7ad6fa0-d05a-4f29-b05d-73111b10a554","year":2022},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:08.683479Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:82c27e0d6b9d71ecb0036e0b292e9729c1394f126ff5eb7980e5b74112864290","observation_id":"5cd787c3-1d4a-4e53-82d9-7dfe83fd4d3c","resolution":{"observed_at":"2026-08-06T21:37:09.336727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.317619Z","title":"Learning to prompt for vision-language models","venue":null,"work_id":"b6e32244-1984-4260-9a8f-20a6348e91f9","year":2022},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:08.801070Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:524bdec9455735551e25f274bbdb8416cf3d0cb036e29773fc228f2dc827b84d","observation_id":"f5b47bc4-f299-46af-a8da-1e0ec522b2e6","resolution":{"observed_at":"2026-08-06T21:37:09.322179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.298504Z","title":"fully connected (fc) + ReLU","venue":null,"work_id":"95b82308-4061-4e4a-9b47-dd073a4cd25a","year":null},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:08.863444Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:5ab753742834fec4f4c5f952dd18c0955e0c9896e49ca35043f7f7123ad85342","observation_id":"0e5d6e64-5eae-4609-bc1c-f0d391d14a4d","resolution":{"observed_at":"2026-08-06T21:37:09.304934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.278501Z","title":"4.3 of the main text, we provide detailed transfer results on the ODinW13 subsets [ 31] in Tab","venue":null,"work_id":"9d070a39-e181-442b-bc9e-cf1bb0a8ae83","year":null},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:08.869019Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:2f11889d1d38d83ce67225c5d6bea43b1f62a71efddf86b48fafefdd77d06002","observation_id":"08b86e82-9e0c-4100-8457-b110e286e90a","resolution":{"observed_at":"2026-08-06T21:37:09.283734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.262640Z","title":null,"venue":null,"work_id":"2f814663-4454-44ae-8ccc-aefbee92a0ca","year":null},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:08.873838Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:95f0ad6557f3202b288b9a4974c20471b991c4957cc29cf94956e4bec22f53da","observation_id":"d24f22c8-c160-4757-98b8-9f389092278b","resolution":{"observed_at":"2026-08-06T21:37:09.267762Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.241430Z","title":"8, we report the computational overhead for process- ing one image using GLIP-L on RTX3090 with one support image, comparing it to MQ-Det and GLIP-FF","venue":null,"work_id":"d7161199-29d0-437f-8e23-54c592c34c69","year":null},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:08.880919Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:59546dec0dca114e08d8ea023100a0ba9bfb201b3ecbf31ce83556aa6d0883df","observation_id":"089e77eb-2e4a-4a55-8010-4c8199a976db","resolution":{"observed_at":"2026-08-06T21:37:09.247972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.218819Z","title":"BG blur\" technique performs best. It high- lights the target object while preserving some background, unlike","venue":null,"work_id":"bf570e34-756a-4cbe-9b7c-80af32a0ce54","year":null},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:08.889886Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:f9a4f0c2257efbe5bc7fee09c066c6b36e5bbe6a805ef346b211774c91cb5a80","observation_id":"254e521a-4c25-470c-9c16-6511e3952a71","resolution":{"observed_at":"2026-08-06T21:37:09.227510Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:37:09.197290Z","title":"Base- line","venue":null,"work_id":"e5d640c7-8dec-411d-abe0-8450e8d24c7a","year":null},"citing_paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:08.897852Z"},"links":{"citing_paper":"/paper/2506.23785"},"observation_digest":"sha256:f18b2f27e74d22395d26b3b8e816ff4fa3871e2f50d65f164b7f91a3c41b509b","observation_id":"a9ddc82e-4ae4-4035-b9c4-0517e3f24bc1","resolution":{"observed_at":"2026-08-06T21:37:09.203949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.23785","last_updated":"2025-06-30T12:27:35Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T06:36:12.361445Z","submitted_at":"2025-06-30T12:27:35Z","title":"Visual Textualization for Image Prompted Object Detection"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":51},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 0 inbound Pith citation observations for arXiv:2506.23785."}