{"as_of":"2026-08-21T09:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:52c1878be28912e07de84d4ffdaba339b63706bf99b68296f7adcce5da2f284c","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T13:44:59.042817Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.28271/citation-record","integrity":"/paper/2605.28271/integrity","json":"/paper/2605.28271/citation-record.json","paper":"/paper/2605.28271"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:44:59.042817Z","title":"You only look once: Unified, real-time object detection","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2605.28271","last_updated":"2026-05-27T10:17:56Z","snapshot_observed_at":"2026-08-20T06:40:04.609386Z","submitted_at":"2026-05-27T10:17:56Z","title":"LV-OSD: Language-Vision-Complementary Open-Set Object Detection","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T13:44:59.042817Z"},"links":{"citing_paper":"/paper/2605.28271"},"observation_digest":"sha256:2df8c42a651cab58cc42c3c4d92aa777145e2c893c3e8c71bf97d0166d389df7","observation_id":"87a918d1-183f-42e0-a1b9-362b332d500b","resolution":{"observed_at":"2026-06-29T13:44:59.042817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:44:59.042817Z","title":"Faster r-cnn: Towards real-time object detection with region proposal networks.IEEE transactions on pattern analysis and machine intelligence, 39(6):1137– 1149, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2605.28271","last_updated":"2026-05-27T10:17:56Z","snapshot_observed_at":"2026-08-20T06:40:04.609386Z","submitted_at":"2026-05-27T10:17:56Z","title":"LV-OSD: Language-Vision-Complementary Open-Set Object Detection","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T13:44:59.042817Z"},"links":{"citing_paper":"/paper/2605.28271"},"observation_digest":"sha256:cc32473c890c470db41e9f371a1a31a5d2dff080d11a6b4a6030dc3660c991f8","observation_id":"34ecc6ad-c675-42a4-a0d1-37d45b581dbf","resolution":{"observed_at":"2026-06-29T13:44:59.042817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:44:59.042817Z","title":"Towards open-set object detection and discovery","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.28271","last_updated":"2026-05-27T10:17:56Z","snapshot_observed_at":"2026-08-20T06:40:04.609386Z","submitted_at":"2026-05-27T10:17:56Z","title":"LV-OSD: Language-Vision-Complementary Open-Set Object Detection","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T13:44:59.042817Z"},"links":{"citing_paper":"/paper/2605.28271"},"observation_digest":"sha256:07a0df578493d2197a00e4e00b0a1a6b6cc80478c0714d52d7fb029c08dc17ac","observation_id":"4188f607-7e64-4cd0-9171-d571ed77e1b7","resolution":{"observed_at":"2026-06-29T13:44:59.042817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:44:59.042817Z","title":"Open-vocabulary object detection using captions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.28271","last_updated":"2026-05-27T10:17:56Z","snapshot_observed_at":"2026-08-20T06:40:04.609386Z","submitted_at":"2026-05-27T10:17:56Z","title":"LV-OSD: Language-Vision-Complementary Open-Set Object Detection","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T13:44:59.042817Z"},"links":{"citing_paper":"/paper/2605.28271"},"observation_digest":"sha256:0c06c0d0679edbba010d8c220678ed7d90c2d39503b8e21a35b9314d1fef7aba","observation_id":"32f95a26-a31d-44cb-aa80-0fe9d33612f0","resolution":{"observed_at":"2026-06-29T13:44:59.042817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:44:59.042817Z","title":"Few-shot object detection via improved classification features","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.28271","last_updated":"2026-05-27T10:17:56Z","snapshot_observed_at":"2026-08-20T06:40:04.609386Z","submitted_at":"2026-05-27T10:17:56Z","title":"LV-OSD: Language-Vision-Complementary Open-Set Object Detection","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T13:44:59.042817Z"},"links":{"citing_paper":"/paper/2605.28271"},"observation_digest":"sha256:bb073ee1bc0d44656c3902fe042b1b21f3a26f475b4aa547ec9235d3a43c0ebf","observation_id":"b47fa664-f21c-45a9-8217-3fa710ec5627","resolution":{"observed_at":"2026-06-29T13:44:59.042817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:44:59.042817Z","title":"Fine-grained prototypes distillation for few-shot object detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.28271","last_updated":"2026-05-27T10:17:56Z","snapshot_observed_at":"2026-08-20T06:40:04.609386Z","submitted_at":"2026-05-27T10:17:56Z","title":"LV-OSD: Language-Vision-Complementary Open-Set Object Detection","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T13:44:59.042817Z"},"links":{"citing_paper":"/paper/2605.28271"},"observation_digest":"sha256:2f8b3b21c34e1101c5c92641a1ef85aa7ec03ab14787ae29e54eccb561580b7d","observation_id":"18eb45d4-32ac-4af8-ad9f-661ab2cc6d7e","resolution":{"observed_at":"2026-06-29T13:44:59.042817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:44:59.042817Z","title":"Balanced and hierarchical relation learning for one-shot object detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.28271","last_updated":"2026-05-27T10:17:56Z","snapshot_observed_at":"2026-08-20T06:40:04.609386Z","submitted_at":"2026-05-27T10:17:56Z","title":"LV-OSD: Language-Vision-Complementary Open-Set Object Detection","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T13:44:59.042817Z"},"links":{"citing_paper":"/paper/2605.28271"},"observation_digest":"sha256:884c03cf441f5be81485a1780d6fc5060b6478cba4604e82dcc9c1b163e5ccbe","observation_id":"c77f19ae-e0cb-4dfb-97e1-2fb93358f8fe","resolution":{"observed_at":"2026-06-29T13:44:59.042817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:44:59.042817Z","title":"Exploring base-class suppression with prior guidance for bias-free one-shot object detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.28271","last_updated":"2026-05-27T10:17:56Z","snapshot_observed_at":"2026-08-20T06:40:04.609386Z","submitted_at":"2026-05-27T10:17:56Z","title":"LV-OSD: Language-Vision-Complementary Open-Set Object Detection","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T13:44:59.042817Z"},"links":{"citing_paper":"/paper/2605.28271"},"observation_digest":"sha256:d2f06e7789fe6eaaca3a7278a6dd5076ce33c99996091d68760cb0010f6c2468","observation_id":"23bf707e-492c-40b4-be0a-3db009814610","resolution":{"observed_at":"2026-06-29T13:44:59.042817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:44:59.042817Z","title":"Toward generalized few-shot open-set object detection.IEEE Transactions on Image Processing, 33:1389–1402, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.28271","last_updated":"2026-05-27T10:17:56Z","snapshot_observed_at":"2026-08-20T06:40:04.609386Z","submitted_at":"2026-05-27T10:17:56Z","title":"LV-OSD: Language-Vision-Complementary Open-Set Object Detection","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T13:44:59.042817Z"},"links":{"citing_paper":"/paper/2605.28271"},"observation_digest":"sha256:6372bf1db3b8b51ec652465bf53f6168b4b5f0347f69962e3ac1e97a117c61f0","observation_id":"af8cb5aa-8e1a-441f-9ae4-c20726d5cf2e","resolution":{"observed_at":"2026-06-29T13:44:59.042817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:44:59.042817Z","title":"Open-vocabulary detr with conditional matching","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.28271","last_updated":"2026-05-27T10:17:56Z","snapshot_observed_at":"2026-08-20T06:40:04.609386Z","submitted_at":"2026-05-27T10:17:56Z","title":"LV-OSD: Language-Vision-Complementary Open-Set Object Detection","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T13:44:59.042817Z"},"links":{"citing_paper":"/paper/2605.28271"},"observation_digest":"sha256:357ab2111fa8673035d769b11b42048c940d54a89da75ec74f438f04b7db7897","observation_id":"974810d2-5f98-4dc4-9e89-d722a3bb6fd5","resolution":{"observed_at":"2026-06-29T13:44:59.042817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:44:59.042817Z","title":"Multi-modal classi- fiers for open-vocabulary object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.28271","last_updated":"2026-05-27T10:17:56Z","snapshot_observed_at":"2026-08-20T06:40:04.609386Z","submitted_at":"2026-05-27T10:17:56Z","title":"LV-OSD: Language-Vision-Complementary Open-Set Object Detection","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T13:44:59.042817Z"},"links":{"citing_paper":"/paper/2605.28271"},"observation_digest":"sha256:efa95b1d6e53fed72e2728166210d623e37d992dbcd94e1361b07135223c40d1","observation_id":"ac4dde01-1573-479f-bf7c-fb4ff4503155","resolution":{"observed_at":"2026-06-29T13:44:59.042817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:44:59.042817Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.28271","last_updated":"2026-05-27T10:17:56Z","snapshot_observed_at":"2026-08-20T06:40:04.609386Z","submitted_at":"2026-05-27T10:17:56Z","title":"LV-OSD: Language-Vision-Complementary Open-Set Object Detection","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T13:44:59.042817Z"},"links":{"citing_paper":"/paper/2605.28271"},"observation_digest":"sha256:5855d958a0ee2fcd528b37d9c01da7325d39594e0c33194e14309aab50c7482c","observation_id":"9d095ee4-dce3-43aa-ae41-43c2cccbf28c","resolution":{"observed_at":"2026-06-29T13:44:59.042817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:44:59.042817Z","title":"Contrastive feature masking open-vocabulary vision transformer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.28271","last_updated":"2026-05-27T10:17:56Z","snapshot_observed_at":"2026-08-20T06:40:04.609386Z","submitted_at":"2026-05-27T10:17:56Z","title":"LV-OSD: Language-Vision-Complementary Open-Set Object Detection","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T13:44:59.042817Z"},"links":{"citing_paper":"/paper/2605.28271"},"observation_digest":"sha256:e6849d7ee464d0b45809a011088ca44ec243c4b57b63858d472950e662b5fa38","observation_id":"47b3a35f-23b0-4496-bae6-8eea7f965ba8","resolution":{"observed_at":"2026-06-29T13:44:59.042817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00161","last_updated":"2024-07-19T02:11:04Z","snapshot_observed_at":"2026-08-16T14:56:22.122052Z","submitted_at":"2023-09-29T21:56:37Z","title":"Region-centric Image-Language Pretraining for Open-Vocabulary Detection","version":2},"cited_work":{"arxiv_id":"2310.00161","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.00161","snapshot_observed_at":"2026-06-29T13:53:28.943438Z","title":"Detection-oriented image-text pretraining for open-vocabulary detection.arXiv preprint arXiv:2310.00161, 2023","venue":null,"work_id":"866ee713-a6f9-4fff-aa7a-f1d7eb83f774","year":2023},"citing_paper":{"arxiv_id":"2605.28271","last_updated":"2026-05-27T10:17:56Z","snapshot_observed_at":"2026-08-20T06:40:04.609386Z","submitted_at":"2026-05-27T10:17:56Z","title":"LV-OSD: Language-Vision-Complementary Open-Set Object Detection","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T13:44:59.042817Z"},"links":{"cited_paper":"/paper/2310.00161","citing_paper":"/paper/2605.28271"},"observation_digest":"sha256:d501cda6ff896c0ecd02578fac3f542b80deabd089d74761aade41e265a7b548","observation_id":"39702702-2fd3-406d-9c81-0a3cfd6eda72","resolution":{"observed_at":"2026-06-29T13:53:28.944955Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:44:59.042817Z","title":"Region-aware pre- training for open-vocabulary object detection with vision transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.28271","last_updated":"2026-05-27T10:17:56Z","snapshot_observed_at":"2026-08-20T06:40:04.609386Z","submitted_at":"2026-05-27T10:17:56Z","title":"LV-OSD: Language-Vision-Complementary Open-Set Object Detection","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T13:44:59.042817Z"},"links":{"citing_paper":"/paper/2605.28271"},"observation_digest":"sha256:5f7d60d390783f7b2e3b5c52871a92c1eef2425921381c041bfde94698b49533","observation_id":"f0230875-16a3-4f44-a1e4-15c9ac1c4267","resolution":{"observed_at":"2026-06-29T13:44:59.042817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:44:59.042817Z","title":"Cora: Adapting clip for open-vocabulary detection with region prompting and anchor pre-matching","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.28271","last_updated":"2026-05-27T10:17:56Z","snapshot_observed_at":"2026-08-20T06:40:04.609386Z","submitted_at":"2026-05-27T10:17:56Z","title":"LV-OSD: Language-Vision-Complementary Open-Set Object Detection","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T13:44:59.042817Z"},"links":{"citing_paper":"/paper/2605.28271"},"observation_digest":"sha256:784a90d44cce5e9fd0c1d24dc0f2ac3237b5d408c3e0d4bb9e4a89009884c10d","observation_id":"78a01b33-2587-4192-9ce6-2a9157861902","resolution":{"observed_at":"2026-06-29T13:44:59.042817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.14386","last_updated":"2023-03-25T07:31:08Z","snapshot_observed_at":"2026-08-20T09:48:43.979095Z","submitted_at":"2023-03-25T07:31:08Z","title":"Prompt-Guided Transformers for End-to-End Open-Vocabulary Object Detection","version":1},"cited_work":{"arxiv_id":"2303.14386","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.14386","snapshot_observed_at":"2026-06-29T13:53:28.940741Z","title":"Prompt-guided transformers for end-to-end open-vocabulary object detection.arXiv preprint arXiv:2303.14386, 2023","venue":null,"work_id":"b11b998b-caf8-4b43-b02d-da5c6b818c64","year":2023},"citing_paper":{"arxiv_id":"2605.28271","last_updated":"2026-05-27T10:17:56Z","snapshot_observed_at":"2026-08-20T06:40:04.609386Z","submitted_at":"2026-05-27T10:17:56Z","title":"LV-OSD: Language-Vision-Complementary Open-Set Object Detection","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-29T13:44:59.042817Z"},"links":{"cited_paper":"/paper/2303.14386","citing_paper":"/paper/2605.28271"},"observation_digest":"sha256:8c0f5879ad82c295a963d385ccd5338d945050945cf1675c536660feb2fbe56b","observation_id":"7ba7fd08-971b-4b7a-8b4d-6edc506a847e","resolution":{"observed_at":"2026-06-29T13:53:28.942340Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:44:59.042817Z","title":"Detecting twenty-thousand classes using image-level supervision","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.28271","last_updated":"2026-05-27T10:17:56Z","snapshot_observed_at":"2026-08-20T06:40:04.609386Z","submitted_at":"2026-05-27T10:17:56Z","title":"LV-OSD: Language-Vision-Complementary Open-Set Object Detection","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T13:44:59.042817Z"},"links":{"citing_paper":"/paper/2605.28271"},"observation_digest":"sha256:362a4cf2be6b43647c6dcf1bc48d68fd79cc24538f7b26ef3fcab1390110189c","observation_id":"db26f206-b1f7-48e7-82a2-e5ce6f049a49","resolution":{"observed_at":"2026-06-29T13:44:59.042817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:44:59.042817Z","title":"Regionclip: Region-based language-image pretraining","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.28271","last_updated":"2026-05-27T10:17:56Z","snapshot_observed_at":"2026-08-20T06:40:04.609386Z","submitted_at":"2026-05-27T10:17:56Z","title":"LV-OSD: Language-Vision-Complementary Open-Set Object Detection","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T13:44:59.042817Z"},"links":{"citing_paper":"/paper/2605.28271"},"observation_digest":"sha256:37176d7f778e6e9ccf2901231db5b3162a4253d8c6a5a99b942b0460178dc49e","observation_id":"fee58c77-b20d-4885-8e66-f192a68d23da","resolution":{"observed_at":"2026-06-29T13:44:59.042817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:44:59.042817Z","title":"Proxydet: Synthesizing proxy novel classes via classwise mixup for open-vocabulary object detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.28271","last_updated":"2026-05-27T10:17:56Z","snapshot_observed_at":"2026-08-20T06:40:04.609386Z","submitted_at":"2026-05-27T10:17:56Z","title":"LV-OSD: Language-Vision-Complementary Open-Set Object Detection","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-29T13:44:59.042817Z"},"links":{"citing_paper":"/paper/2605.28271"},"observation_digest":"sha256:37cecd0f50a8067ca6352511a22e7cd1aafdd5dae1a68f30a3045d7181a11398","observation_id":"8d625fde-35c2-4cf8-a1fe-a0fccd755c7f","resolution":{"observed_at":"2026-06-29T13:44:59.042817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:44:59.042817Z","title":"Codet: Co-occurrence guided region-word alignment for open-vocabulary object detection.Advances in neural information processing systems, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.28271","last_updated":"2026-05-27T10:17:56Z","snapshot_observed_at":"2026-08-20T06:40:04.609386Z","submitted_at":"2026-05-27T10:17:56Z","title":"LV-OSD: Language-Vision-Complementary Open-Set Object Detection","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T13:44:59.042817Z"},"links":{"citing_paper":"/paper/2605.28271"},"observation_digest":"sha256:59e6907c807fa31afdd7bf1d74531294e5a33e398d53f3ca419d132a198c81ee","observation_id":"c739480a-c4fa-4399-99f2-88f5168f6575","resolution":{"observed_at":"2026-06-29T13:44:59.042817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.13921","last_updated":"2022-05-12T01:27:40Z","snapshot_observed_at":"2026-08-16T03:57:01.951598Z","submitted_at":"2021-04-28T17:58:57Z","title":"Open-vocabulary Object Detection via Vision and Language Knowledge Distillation","version":3},"cited_work":{"arxiv_id":"2104.13921","doi":null,"metadata_source":"pith","pith_arxiv_id":"2104.13921","snapshot_observed_at":"2026-07-04T16:29:57.549240Z","title":"Open-vocabulary Object Detection via Vision and Language Knowledge Distillation","venue":"cs.CV","work_id":"59541f32-18cf-4328-ad60-c9018e1401cf","year":2021},"citing_paper":{"arxiv_id":"2605.28271","last_updated":"2026-05-27T10:17:56Z","snapshot_observed_at":"2026-08-20T06:40:04.609386Z","submitted_at":"2026-05-27T10:17:56Z","title":"LV-OSD: Language-Vision-Complementary Open-Set Object Detection","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T13:44:59.042817Z"},"links":{"cited_paper":"/paper/2104.13921","citing_paper":"/paper/2605.28271"},"observation_digest":"sha256:c7dc663899e7b6a01d5e110a24b726702d88802278b33f43fc3130f48ab06c34","observation_id":"62634be7-de25-4051-afa8-3216c18b24ba","resolution":{"observed_at":"2026-06-29T13:53:28.937564Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:44:59.042817Z","title":"Lp-ovod: Open-vocabulary object detection by linear probing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.28271","last_updated":"2026-05-27T10:17:56Z","snapshot_observed_at":"2026-08-20T06:40:04.609386Z","submitted_at":"2026-05-27T10:17:56Z","title":"LV-OSD: Language-Vision-Complementary Open-Set Object Detection","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-29T13:44:59.042817Z"},"links":{"citing_paper":"/paper/2605.28271"},"observation_digest":"sha256:4596d0b386c546fac8498656c26fc9d6359ac0c43839c8e5a5f43cdb1ca4762e","observation_id":"6cf1dd02-af54-4864-9658-54b9a8f6b62c","resolution":{"observed_at":"2026-06-29T13:44:59.042817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:44:59.042817Z","title":"Bridging the gap between object and image-level representations for open-vocabulary detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.28271","last_updated":"2026-05-27T10:17:56Z","snapshot_observed_at":"2026-08-20T06:40:04.609386Z","submitted_at":"2026-05-27T10:17:56Z","title":"LV-OSD: Language-Vision-Complementary Open-Set Object Detection","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-29T13:44:59.042817Z"},"links":{"citing_paper":"/paper/2605.28271"},"observation_digest":"sha256:3a511eebfcdfe2eb2d2c325933bbbe9b5c793b7e5e7cc76975fb66e889748b8d","observation_id":"286aa16e-7423-4db2-bede-ad6d81c7e353","resolution":{"observed_at":"2026-06-29T13:44:59.042817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:44:59.042817Z","title":"Distilling detr with visual-linguistic knowledge for open-vocabulary object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.28271","last_updated":"2026-05-27T10:17:56Z","snapshot_observed_at":"2026-08-20T06:40:04.609386Z","submitted_at":"2026-05-27T10:17:56Z","title":"LV-OSD: Language-Vision-Complementary Open-Set Object Detection","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-29T13:44:59.042817Z"},"links":{"citing_paper":"/paper/2605.28271"},"observation_digest":"sha256:24e437d4ed463db981be42ee620b4b945686168de35901e772959cf775837350","observation_id":"501f3117-e6ac-488a-9fff-d3601070019a","resolution":{"observed_at":"2026-06-29T13:44:59.042817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:44:59.042817Z","title":"Learning to prompt for open-vocabulary object detection with vision-language model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.28271","last_updated":"2026-05-27T10:17:56Z","snapshot_observed_at":"2026-08-20T06:40:04.609386Z","submitted_at":"2026-05-27T10:17:56Z","title":"LV-OSD: Language-Vision-Complementary Open-Set Object Detection","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-29T13:44:59.042817Z"},"links":{"citing_paper":"/paper/2605.28271"},"observation_digest":"sha256:16fc1de23acef7aff6546f46c5642fb7cf32681acdac05df3e749b84edfd2a2a","observation_id":"8a214438-1a3e-4d25-b5fa-3896d4dc21ff","resolution":{"observed_at":"2026-06-29T13:44:59.042817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15639","last_updated":"2023-02-23T19:14:52Z","snapshot_observed_at":"2026-08-16T16:27:46.006186Z","submitted_at":"2022-09-30T17:59:52Z","title":"F-VLM: Open-Vocabulary Object Detection upon Frozen Vision and Language Models","version":2},"cited_work":{"arxiv_id":"2209.15639","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2209.15639","snapshot_observed_at":"2026-07-03T00:57:30.385197Z","title":"F-vlm: Open-vocabulary object detection upon frozen vision and language models","venue":null,"work_id":"2e2ab981-0561-40ab-a804-85d58df32d35","year":2022},"citing_paper":{"arxiv_id":"2605.28271","last_updated":"2026-05-27T10:17:56Z","snapshot_observed_at":"2026-08-20T06:40:04.609386Z","submitted_at":"2026-05-27T10:17:56Z","title":"LV-OSD: Language-Vision-Complementary Open-Set Object Detection","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-29T13:44:59.042817Z"},"links":{"cited_paper":"/paper/2209.15639","citing_paper":"/paper/2605.28271"},"observation_digest":"sha256:637cbf8fc887ccc812dbddea72b358bb40be9f05f7d2260ec388a270c9a393a1","observation_id":"b7aeed7d-d168-43ee-adea-6bbe2b876d95","resolution":{"observed_at":"2026-06-29T13:53:28.953364Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.06230","last_updated":"2022-07-20T12:24:25Z","snapshot_observed_at":"2026-08-20T03:26:23.121586Z","submitted_at":"2022-05-12T17:20:36Z","title":"Simple Open-Vocabulary Object Detection with Vision Transformers","version":2},"cited_work":{"arxiv_id":"2205.06230","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2205.06230","snapshot_observed_at":"2026-07-04T12:59:53.224246Z","title":"Simple open-vocabulary object detection with vision transformers","venue":null,"work_id":"4a029835-bd63-4b98-ab43-d2ff7887490d","year":2022},"citing_paper":{"arxiv_id":"2605.28271","last_updated":"2026-05-27T10:17:56Z","snapshot_observed_at":"2026-08-20T06:40:04.609386Z","submitted_at":"2026-05-27T10:17:56Z","title":"LV-OSD: Language-Vision-Complementary Open-Set Object Detection","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-29T13:44:59.042817Z"},"links":{"cited_paper":"/paper/2205.06230","citing_paper":"/paper/2605.28271"},"observation_digest":"sha256:b2fc30e6b7a52997d3289b837440ce3150d523296853915fa51da8922f8c49e8","observation_id":"7fb8cad5-9bb0-4a2a-a481-d87715022c2e","resolution":{"observed_at":"2026-06-29T13:53:28.950038Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01403","last_updated":"2024-01-24T18:11:53Z","snapshot_observed_at":"2026-08-17T19:34:59.417167Z","submitted_at":"2023-10-02T17:58:52Z","title":"CLIPSelf: Vision Transformer Distills Itself for Open-Vocabulary Dense Prediction","version":2},"cited_work":{"arxiv_id":"2310.01403","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.01403","snapshot_observed_at":"2026-07-09T19:36:29.291166Z","title":"Clipself: Vision transformer distills itself for open-vocabulary dense prediction","venue":"cs.CV","work_id":"7f8eb5a6-be08-4e4f-ada8-50f9cfe9f314","year":2023},"citing_paper":{"arxiv_id":"2605.28271","last_updated":"2026-05-27T10:17:56Z","snapshot_observed_at":"2026-08-20T06:40:04.609386Z","submitted_at":"2026-05-27T10:17:56Z","title":"LV-OSD: Language-Vision-Complementary Open-Set Object Detection","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-29T13:44:59.042817Z"},"links":{"cited_paper":"/paper/2310.01403","citing_paper":"/paper/2605.28271"},"observation_digest":"sha256:4f92036a9b7359ad9addea4537e2275adf8b823448e158ecf0fb7a409dcfcf78","observation_id":"2bf167c7-b5f3-4995-8c30-2ed54fdedc5b","resolution":{"observed_at":"2026-06-29T13:53:28.956398Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:44:59.042817Z","title":"Dst-det: Open-vocabulary object detection via dynamic self-training.IEEE Transactions on Circuits and Systems for Video Technology, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.28271","last_updated":"2026-05-27T10:17:56Z","snapshot_observed_at":"2026-08-20T06:40:04.609386Z","submitted_at":"2026-05-27T10:17:56Z","title":"LV-OSD: Language-Vision-Complementary Open-Set Object Detection","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-29T13:44:59.042817Z"},"links":{"citing_paper":"/paper/2605.28271"},"observation_digest":"sha256:df9d9cb2605066fdfbdb20a6f546b61bd8376d19de0c28dca89724313e02b656","observation_id":"63a64a85-d338-4d56-942e-362b6b2e3d44","resolution":{"observed_at":"2026-06-29T13:44:59.042817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:44:59.042817Z","title":"Declip: Decoupled learning for open-vocabulary dense percep- tion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.28271","last_updated":"2026-05-27T10:17:56Z","snapshot_observed_at":"2026-08-20T06:40:04.609386Z","submitted_at":"2026-05-27T10:17:56Z","title":"LV-OSD: Language-Vision-Complementary Open-Set Object Detection","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-29T13:44:59.042817Z"},"links":{"citing_paper":"/paper/2605.28271"},"observation_digest":"sha256:3b4f98aaeb566e098664eac14e7b0c9384dbbf3881005322681d4f91bd0a880c","observation_id":"dcad1189-4599-44c3-98ec-2a178cd75c33","resolution":{"observed_at":"2026-06-29T13:44:59.042817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:44:59.042817Z","title":"Integrally migrating pre-trained trans- former encoder-decoders for visual object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.28271","last_updated":"2026-05-27T10:17:56Z","snapshot_observed_at":"2026-08-20T06:40:04.609386Z","submitted_at":"2026-05-27T10:17:56Z","title":"LV-OSD: Language-Vision-Complementary Open-Set Object Detection","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-29T13:44:59.042817Z"},"links":{"citing_paper":"/paper/2605.28271"},"observation_digest":"sha256:c4d217bd8f648dbf9d6bc3b35f5407e1cf6a7dbebc26c430e6068b267db9a2fd","observation_id":"1629db98-2b36-4bd6-bf3a-b571a5233aa7","resolution":{"observed_at":"2026-06-29T13:44:59.042817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:44:59.042817Z","title":"Snida: Unlocking few-shot object detection with non-linear semantic decoupling augmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.28271","last_updated":"2026-05-27T10:17:56Z","snapshot_observed_at":"2026-08-20T06:40:04.609386Z","submitted_at":"2026-05-27T10:17:56Z","title":"LV-OSD: Language-Vision-Complementary Open-Set Object Detection","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-29T13:44:59.042817Z"},"links":{"citing_paper":"/paper/2605.28271"},"observation_digest":"sha256:8679e78c0ba671f7cfb2253d07e791ce8e5249da2d12b44ed1d7b581bb61cd8b","observation_id":"0c5d1415-7d24-4dc1-befc-f0b10732e607","resolution":{"observed_at":"2026-06-29T13:44:59.042817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:44:59.042817Z","title":"Temporal speciation network for few- shot object detection.IEEE Transactions on Multimedia, 25:8267–8278, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.28271","last_updated":"2026-05-27T10:17:56Z","snapshot_observed_at":"2026-08-20T06:40:04.609386Z","submitted_at":"2026-05-27T10:17:56Z","title":"LV-OSD: Language-Vision-Complementary Open-Set Object Detection","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-29T13:44:59.042817Z"},"links":{"citing_paper":"/paper/2605.28271"},"observation_digest":"sha256:4f82c90baed8ee0d68d3e08175828b2b813e13b2f3be837dc1a522de460dd918","observation_id":"721044c7-0a02-46d9-bbbe-44aa382f8519","resolution":{"observed_at":"2026-06-29T13:44:59.042817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:44:59.042817Z","title":"Binary similarity few-shot object detection with modeling of hard negative samples.IEEE Transactions on Multimedia, 26:4805–4818, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.28271","last_updated":"2026-05-27T10:17:56Z","snapshot_observed_at":"2026-08-20T06:40:04.609386Z","submitted_at":"2026-05-27T10:17:56Z","title":"LV-OSD: Language-Vision-Complementary Open-Set Object Detection","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-29T13:44:59.042817Z"},"links":{"citing_paper":"/paper/2605.28271"},"observation_digest":"sha256:da27eb42332fbb5e2dbe3a622c9041d8bd9f60885dfc5f1fc8d1f2a4fb6fc5ff","observation_id":"2e38df3a-b4bc-49cb-ac87-321c35e2c0f5","resolution":{"observed_at":"2026-06-29T13:44:59.042817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:44:59.042817Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.28271","last_updated":"2026-05-27T10:17:56Z","snapshot_observed_at":"2026-08-20T06:40:04.609386Z","submitted_at":"2026-05-27T10:17:56Z","title":"LV-OSD: Language-Vision-Complementary Open-Set Object Detection","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-29T13:44:59.042817Z"},"links":{"citing_paper":"/paper/2605.28271"},"observation_digest":"sha256:fe5d1542606673f25bf7725d882ef1cd75958fa3e10ec848ca2c7d39c5eb6ec8","observation_id":"427068c3-c705-4ca0-95cf-6d7ae3cec0af","resolution":{"observed_at":"2026-06-29T13:44:59.042817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:44:59.042817Z","title":"Mind the gap: Understanding the modality gap in multi-modal contrastive representation learning.Advances in Neural Information Processing Systems, 35:17612–17625, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.28271","last_updated":"2026-05-27T10:17:56Z","snapshot_observed_at":"2026-08-20T06:40:04.609386Z","submitted_at":"2026-05-27T10:17:56Z","title":"LV-OSD: Language-Vision-Complementary Open-Set Object Detection","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-29T13:44:59.042817Z"},"links":{"citing_paper":"/paper/2605.28271"},"observation_digest":"sha256:01ce15c793f2c0ccf8cc93b4bc1e0bda06452eb0f68b52e3ef08d61602e78f0a","observation_id":"c9fe0c13-48c9-40e9-a1c0-3203babdb534","resolution":{"observed_at":"2026-06-29T13:44:59.042817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2605.28271","last_updated":"2026-05-27T10:17:56Z","snapshot_observed_at":"2026-08-20T06:40:04.609386Z","submitted_at":"2026-05-27T10:17:56Z","title":"LV-OSD: Language-Vision-Complementary Open-Set Object Detection","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-29T13:44:59.042817Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2605.28271"},"observation_digest":"sha256:ecf251eecdead8f5fd6f879b170fc440976cf301e85c1ea11d3367c70e66a12b","observation_id":"70d479f5-c23d-42f1-86d7-dd2c19b238b9","resolution":{"observed_at":"2026-06-29T13:53:28.947380Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10972","last_updated":"2021-08-05T15:04:28Z","snapshot_observed_at":"2026-08-16T18:29:47.623456Z","submitted_at":"2021-04-22T10:10:14Z","title":"ImageNet-21K Pretraining for the Masses","version":4},"cited_work":{"arxiv_id":"2104.10972","doi":"10.48550/arxiv.2104.10972","metadata_source":"arxiv_reference","pith_arxiv_id":"2104.10972","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Imagenet-21k pretraining for the masses","venue":"arXiv (Cornell University)","work_id":"31e88324-e013-43f0-8c70-24aba0fa92fb","year":2021},"citing_paper":{"arxiv_id":"2605.28271","last_updated":"2026-05-27T10:17:56Z","snapshot_observed_at":"2026-08-20T06:40:04.609386Z","submitted_at":"2026-05-27T10:17:56Z","title":"LV-OSD: Language-Vision-Complementary Open-Set Object Detection","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-29T13:44:59.042817Z"},"links":{"cited_paper":"/paper/2104.10972","citing_paper":"/paper/2605.28271"},"observation_digest":"sha256:9c7d821d98ce378f121f9c33b324eacb20e1d4f7d0947ef0a9c8171bafce6091","observation_id":"5bc5ad43-1aa2-4bc4-a926-492004439a8b","resolution":{"observed_at":"2026-06-29T13:53:28.939534Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:44:59.042817Z","title":"Conceptual captions: A cleaned, hypernymed, image alt-text dataset for automatic image captioning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2605.28271","last_updated":"2026-05-27T10:17:56Z","snapshot_observed_at":"2026-08-20T06:40:04.609386Z","submitted_at":"2026-05-27T10:17:56Z","title":"LV-OSD: Language-Vision-Complementary Open-Set Object Detection","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-29T13:44:59.042817Z"},"links":{"citing_paper":"/paper/2605.28271"},"observation_digest":"sha256:317ff57e5bc6b62b74ec6a85a38d1ab36a0548b3d94186cbdfaf7778e5c224c2","observation_id":"e8f6047e-bf48-4cbd-bb70-072ea733a698","resolution":{"observed_at":"2026-06-29T13:44:59.042817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:44:59.042817Z","title":"Mdetr-modulated detection for end- to-end multi-modal understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.28271","last_updated":"2026-05-27T10:17:56Z","snapshot_observed_at":"2026-08-20T06:40:04.609386Z","submitted_at":"2026-05-27T10:17:56Z","title":"LV-OSD: Language-Vision-Complementary Open-Set Object Detection","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-29T13:44:59.042817Z"},"links":{"citing_paper":"/paper/2605.28271"},"observation_digest":"sha256:c3c0676366fcc4e2ab84c7e62cf2b21b7e3102e5e23b34bc09b4cafaa74cf4e8","observation_id":"f496e509-b670-4d76-8b31-391426fab067","resolution":{"observed_at":"2026-06-29T13:44:59.042817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:44:59.042817Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations.International journal of computer vision, 123:32–73, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2605.28271","last_updated":"2026-05-27T10:17:56Z","snapshot_observed_at":"2026-08-20T06:40:04.609386Z","submitted_at":"2026-05-27T10:17:56Z","title":"LV-OSD: Language-Vision-Complementary Open-Set Object Detection","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-29T13:44:59.042817Z"},"links":{"citing_paper":"/paper/2605.28271"},"observation_digest":"sha256:15f33d04091e2e0252f5dcdbc37d70bfc2e5535c610c69ccbfdb30e2597dee77","observation_id":"a30b79f7-7483-40da-b3bc-a0fce05a08ad","resolution":{"observed_at":"2026-06-29T13:44:59.042817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:44:59.042817Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.28271","last_updated":"2026-05-27T10:17:56Z","snapshot_observed_at":"2026-08-20T06:40:04.609386Z","submitted_at":"2026-05-27T10:17:56Z","title":"LV-OSD: Language-Vision-Complementary Open-Set Object Detection","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-29T13:44:59.042817Z"},"links":{"citing_paper":"/paper/2605.28271"},"observation_digest":"sha256:325c5fb4506a8df8a3aa616167f933fc02b773d087c8e7cafc60f71d00804517","observation_id":"a1fd050b-3ed2-44b3-958f-0d2b1f881e57","resolution":{"observed_at":"2026-06-29T13:44:59.042817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:44:59.042817Z","title":"Learning background prompts to discover implicit knowledge for open vocabulary object detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.28271","last_updated":"2026-05-27T10:17:56Z","snapshot_observed_at":"2026-08-20T06:40:04.609386Z","submitted_at":"2026-05-27T10:17:56Z","title":"LV-OSD: Language-Vision-Complementary Open-Set Object Detection","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-29T13:44:59.042817Z"},"links":{"citing_paper":"/paper/2605.28271"},"observation_digest":"sha256:1402246f1abd8f3fdbbf4b8c5be7bd0ea03db721f92a078add72ed5c97d0fe12","observation_id":"db6b726c-5b04-4e76-b498-f8a71b62e203","resolution":{"observed_at":"2026-06-29T13:44:59.042817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:44:59.042817Z","title":"Ov-dquo: Open-vocabulary detr with denoising text query training and open-world unknown objects supervision","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.28271","last_updated":"2026-05-27T10:17:56Z","snapshot_observed_at":"2026-08-20T06:40:04.609386Z","submitted_at":"2026-05-27T10:17:56Z","title":"LV-OSD: Language-Vision-Complementary Open-Set Object Detection","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-29T13:44:59.042817Z"},"links":{"citing_paper":"/paper/2605.28271"},"observation_digest":"sha256:148e6d175663bee6f66d99e827454a25dcbb05646c6c6cf2dde76bb5554ad36c","observation_id":"039dc52c-1038-45ec-a4a2-2195e0198663","resolution":{"observed_at":"2026-06-29T13:44:59.042817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:44:59.042817Z","title":"Object-aware distillation pyramid for open-vocabulary object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.28271","last_updated":"2026-05-27T10:17:56Z","snapshot_observed_at":"2026-08-20T06:40:04.609386Z","submitted_at":"2026-05-27T10:17:56Z","title":"LV-OSD: Language-Vision-Complementary Open-Set Object Detection","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-29T13:44:59.042817Z"},"links":{"citing_paper":"/paper/2605.28271"},"observation_digest":"sha256:a6de4848ae299cca1018f687fc326ef44aab1f79e0cc05451ebc0e22bca13355","observation_id":"517c319a-d7fb-4b55-b901-e13c2743ef8e","resolution":{"observed_at":"2026-06-29T13:44:59.042817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:44:59.042817Z","title":"Taming self-training for open-vocabulary object detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.28271","last_updated":"2026-05-27T10:17:56Z","snapshot_observed_at":"2026-08-20T06:40:04.609386Z","submitted_at":"2026-05-27T10:17:56Z","title":"LV-OSD: Language-Vision-Complementary Open-Set Object Detection","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-29T13:44:59.042817Z"},"links":{"citing_paper":"/paper/2605.28271"},"observation_digest":"sha256:8079326b46ec490495f785fc1666e5cf49ce87d42dbd8e473a0e45b55d068200","observation_id":"8d3399db-d4dd-4ae7-8a1f-4b6863049452","resolution":{"observed_at":"2026-06-29T13:44:59.042817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:44:59.042817Z","title":"Yolo-world: Real-time open-vocabulary object detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.28271","last_updated":"2026-05-27T10:17:56Z","snapshot_observed_at":"2026-08-20T06:40:04.609386Z","submitted_at":"2026-05-27T10:17:56Z","title":"LV-OSD: Language-Vision-Complementary Open-Set Object Detection","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-29T13:44:59.042817Z"},"links":{"citing_paper":"/paper/2605.28271"},"observation_digest":"sha256:72f448e9aab274cb1a0ab21430672748abd94e0cf522c9670e46e16bbb1a9e6d","observation_id":"6fa23255-6f2a-42dc-9202-c37bd7575a16","resolution":{"observed_at":"2026-06-29T13:44:59.042817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.07465","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T17:39:59.453061Z","title":"Yoloe: Real-time seeing anything","venue":null,"work_id":"a0e33ede-c407-42a2-ba32-cf37d849c193","year":2025},"citing_paper":{"arxiv_id":"2605.28271","last_updated":"2026-05-27T10:17:56Z","snapshot_observed_at":"2026-08-20T06:40:04.609386Z","submitted_at":"2026-05-27T10:17:56Z","title":"LV-OSD: Language-Vision-Complementary Open-Set Object Detection","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-29T13:44:59.042817Z"},"links":{"citing_paper":"/paper/2605.28271"},"observation_digest":"sha256:f8a983f2e51a296910f602c3d133af0171f8872f27b1f462631bb509c10f005c","observation_id":"851fd58c-f2aa-4de8-9ec6-7aa79227dbeb","resolution":{"observed_at":"2026-06-29T13:53:28.933733Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:44:59.042817Z","title":"Objects365: A large-scale, high- quality dataset for object detection","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.28271","last_updated":"2026-05-27T10:17:56Z","snapshot_observed_at":"2026-08-20T06:40:04.609386Z","submitted_at":"2026-05-27T10:17:56Z","title":"LV-OSD: Language-Vision-Complementary Open-Set Object Detection","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-29T13:44:59.042817Z"},"links":{"citing_paper":"/paper/2605.28271"},"observation_digest":"sha256:538341171ecc8a7a93017826de33fbdae3f2a5856dc8531a9d7e12b04e99e7c5","observation_id":"2d82705b-4d18-425b-8455-3531ce73c74d","resolution":{"observed_at":"2026-06-29T13:44:59.042817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2605.28271","last_updated":"2026-05-27T10:17:56Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-20T06:40:04.609386Z","submitted_at":"2026-05-27T10:17:56Z","title":"LV-OSD: Language-Vision-Complementary Open-Set Object Detection"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":9,"verified_fuzzy":0},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 0 inbound Pith citation observations for arXiv:2605.28271."}