{"as_of":"2026-08-16T12:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5357c447c6b4cefdc3199c6c6fea077d791af0c9c8102b09f908cf1755e15bf3","coverage":[{"denominator":85,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":85,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T04:32:44.459932Z","state":"measured"},{"denominator":85,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":85,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.18806/citation-record","integrity":"/paper/2412.18806/integrity","json":"/paper/2412.18806/citation-record.json","paper":"/paper/2412.18806"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.172563Z","title":"Label-embedding for image classification","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.172563Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:f6633dd52fdf1825438751e3ebfed29e313e8f44f744a37df4d4355d4a4dd5ac","observation_id":"ec488dff-669b-41a2-bbff-64aa37573a2a","resolution":{"observed_at":"2026-08-11T04:32:44.172563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.176758Z","title":"Bottom-up and top-down attention for image captioning and visual question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.176758Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:2bb12addeeb160c3b486a6570921c18d6dcde73b37f99916af85d3c1e0c515b2","observation_id":"c125ee8e-1fac-4ae5-93ba-7684d01cdf5d","resolution":{"observed_at":"2026-08-11T04:32:44.176758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.184879Z","title":"Pseudo-labeling and confirmation bias in deep semi-supervised learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.184879Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:64de5df4682050fd271e5ae10c8546260b0d274a015a7d64c05384608273d6f8","observation_id":"9e82b47a-cec5-48bb-8e04-6d544622e4e8","resolution":{"observed_at":"2026-08-11T04:32:44.184879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.188636Z","title":"Bridg- ing the gap between object and image-level representations for open-vocabulary detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.188636Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:a498a08204489d74c6e3ac6522aeb5ccd6228c6457a3cc4f0f271089f5636da6","observation_id":"d26f7b55-1ea4-47bd-b0f5-230404ba5725","resolution":{"observed_at":"2026-08-11T04:32:44.188636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.408102Z","title":"Zero-shot object detection","venue":null,"work_id":"5728c241-ee70-4b49-8447-e0a409da998e","year":2018},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.192362Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:eb22b63851335b79b8ab75967ab2710e69e5a1cd13f0b1653b916aa197b78180","observation_id":"41970f72-8636-4b34-8d16-633b727c8d03","resolution":{"observed_at":"2026-08-11T04:32:45.411789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.196412Z","title":"Mixmatch: A holistic approach to semi-supervised learning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.196412Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:b55b355f190cc26d2689e6841fa8dd944e5379ae4f799ebb7129df63659de871","observation_id":"05dc9e84-02a1-4631-a38e-71b6cfa5fae3","resolution":{"observed_at":"2026-08-11T04:32:44.196412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.391177Z","title":"Lang, Sourabh V ora, Venice Erin Liong, Qiang Xu, Anush Krishnan, Yu Pan, Gi- ancarlo Baldan, and Oscar Beijbom","venue":null,"work_id":"11c1f31e-e464-4e90-b378-7972c232614c","year":2020},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.200071Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:e6b5e94301c55c065ccc9cd52fdbbf4c80e60865ebb59c4cb17af2e6a4cb3248","observation_id":"17a5de76-97ca-4339-98f7-13b0d9685fbc","resolution":{"observed_at":"2026-08-11T04:32:45.394749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.379931Z","title":"X-detr: A versatile architecture for instance-wise vision- language tasks","venue":null,"work_id":"dc145a04-a4d6-4d5e-aac6-ff2dbba02c00","year":2022},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.203649Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:c59c86f61a1e7e87a4766177387338e4f77b5644d52686bbf19565764e11e974","observation_id":"4e90383b-b9f4-4eec-a88a-bb0a7e0f2dbe","resolution":{"observed_at":"2026-08-11T04:32:45.384161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.369973Z","title":"End-to- end object detection with transformers","venue":null,"work_id":"d084276d-942f-475d-85f1-787e74842b1f","year":2020},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.207011Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:711539d122012f9641e24f26a78fb253a711dff650c3ab54585c4086c6f37d86","observation_id":"f87f0292-183b-4672-acc3-4919ee74a76a","resolution":{"observed_at":"2026-08-11T04:32:45.373408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.359538Z","title":"Big self-supervised mod- els are strong semi-supervised learners","venue":null,"work_id":"d8d55faf-a256-493f-8208-9148d2240925","year":2020},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.210464Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:429846e94131e6bd354aac1c9b573ddf82229b235a6e3e2836342258a6b8eb70","observation_id":"56821bf1-e47b-455d-95fc-595fd94361ff","resolution":{"observed_at":"2026-08-11T04:32:45.363471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.348106Z","title":"UNITER: universal image-text representation learning","venue":null,"work_id":"1ef3b5ef-86a0-4808-ad65-89f89c271fdf","year":2020},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.214032Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:3cd1bb8e4eba3cebadcc4c239821238d74d28289797e6407f006919d689703e1","observation_id":"0a833bd5-93f0-4192-95a1-42d607bf4af8","resolution":{"observed_at":"2026-08-11T04:32:45.352804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.337091Z","title":"Proba- bilistic embeddings for cross-modal retrieval","venue":null,"work_id":"714917c0-7b79-42b9-9ecb-c73374576ff9","year":2021},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.217445Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:7777c17359fcd12e51b6de8b3396c768733a86006e2440d71b6fc000407918fd","observation_id":"61919452-1d70-4fe3-9c12-8542943725a4","resolution":{"observed_at":"2026-08-11T04:32:45.341194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.325844Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"17cc228f-8c82-407c-9fff-b42b9693728f","year":2009},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.220762Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:71bac192d4855180c77fe4bfebd24a4f0c47644bcd57ce49693b854b888b0779","observation_id":"903289dd-14d6-4b02-9e5f-95e5d290c92b","resolution":{"observed_at":"2026-08-11T04:32:45.330048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.313617Z","title":"Finding beans in burgers: Deep semantic- visual embedding with localization","venue":null,"work_id":"5a546476-6178-4add-a94e-3071310df286","year":2018},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.224063Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:162325dff515105a2f145b7ee3e4aae0a5dde7aceec96a49156eb19031d2881d","observation_id":"6ce47396-f825-43a8-a6cf-66eae25fd29f","resolution":{"observed_at":"2026-08-11T04:32:45.318051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.302240Z","title":"Fleet, Jamie Ryan Kiros, and Sanja Fidler","venue":null,"work_id":"c0360840-1c2b-4232-b01f-e5aa5a6c4eb3","year":2018},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.227298Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:103ca52969bc7c26fae0311cb55389d3759f39a82ce4c597a5609ad671d934a5","observation_id":"953e852d-7825-4d4a-95a3-827dbc5c7084","resolution":{"observed_at":"2026-08-11T04:32:45.306459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.290455Z","title":"De- vise: A deep visual-semantic embedding model.Advances in neural information processing systems (NeurIPS), 26, 2013","venue":null,"work_id":"57b128b7-85d3-4e10-800a-a574d18e0811","year":2013},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.230559Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:dee82ab642af9307ea6f09e2bd6b2f75ec60e56ed991ea4f14f77c34b7784d99","observation_id":"06144a13-524b-496b-b7e6-1f4c216a364c","resolution":{"observed_at":"2026-08-11T04:32:45.294893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.279367Z","title":"Understanding the diffi- culty of training deep feedforward neural networks","venue":null,"work_id":"08a28025-454e-4cee-97d4-854602f9ec5f","year":2010},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.233871Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:d20ee1a1074d67993e6c623e587f9729b1262e8c16b3f0cb996bc39dc2693331","observation_id":"3313c946-2ae3-4911-999a-8236d4c16ea0","resolution":{"observed_at":"2026-08-11T04:32:45.283263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.269511Z","title":"Improving image-sentence embeddings using large weakly annotated photo collections","venue":null,"work_id":"7a69ac74-ccef-4fbd-929a-5951be38934b","year":2014},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.237175Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:a5669b487ba0a0b14d91058777108f8ff82d17a2d6b29192d1e598eb753b32f0","observation_id":"6863ac69-5e23-4c13-8d6e-3a8a42c5e877","resolution":{"observed_at":"2026-08-11T04:32:45.272919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.258492Z","title":"Open-vocabulary object detection via vision and language knowledge distillation","venue":null,"work_id":"f6a3bd77-a10d-4ae3-9466-69af7e94f72c","year":2022},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.240663Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:981c117642dcc7175ede94f9d6c9695508960e56770bbf7607d1c51452c5042d","observation_id":"719f7dc7-c08f-42a5-9630-e5623dc54cf3","resolution":{"observed_at":"2026-08-11T04:32:45.262866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.247402Z","title":"Girshick","venue":null,"work_id":"61740e71-e2f7-48f7-9acf-4caa0e9a35bc","year":2019},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.243834Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:779ebc27360743f7d6482a97461fa43f380b16f17ff4ff547b65d0c67a86a0c0","observation_id":"143294bd-f34c-424d-8c02-172b4b6160b1","resolution":{"observed_at":"2026-08-11T04:32:45.251143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.237026Z","title":"Generative multi-label zero-shot learning","venue":null,"work_id":"ffa0f8ee-b539-42c9-8321-5722001075bb","year":2023},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.247322Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:aba1c3a3ff2651e0cffddc7e3192751682e2669f8ee20dea114e23ad7cfbb173","observation_id":"875578ae-d670-4d24-a181-b266a7f3887d","resolution":{"observed_at":"2026-08-11T04:32:45.240567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.226418Z","title":"Mean average precision map@k metric explained code","venue":null,"work_id":"d6df47d2-c4d6-42b0-af8e-316bb5a16c33","year":2022},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.250616Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:9095400b003657df6ee76b3b58cab6bdc17f2eb3c8b54778a30aaba338e44720","observation_id":"e3af98b8-c68a-4ff9-a994-01a437976edf","resolution":{"observed_at":"2026-08-11T04:32:45.229970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.215521Z","title":"Instance-aware im- age and sentence matching with selective multimodal LSTM","venue":null,"work_id":"7fba30da-5762-4c8b-98e8-264a8d22f42a","year":2017},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.253776Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:fe12ba0f1ffd9127dfa505b5758660845de81c1b4f31adf46ac3819103642654","observation_id":"eadb2934-3082-4975-8320-8af75c355b0a","resolution":{"observed_at":"2026-08-11T04:32:45.219450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.00849","last_updated":"2020-06-22T09:09:22Z","snapshot_observed_at":"2026-08-15T14:49:08.287205Z","submitted_at":"2020-04-02T07:39:28Z","title":"Pixel-BERT: Aligning Image Pixels with Text by Deep Multi-Modal Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.00849","snapshot_observed_at":"2026-08-11T04:32:44.256855Z","title":"Pixel-bert: Aligning image pixels with text by deep multi-modal transformers","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.256855Z"},"links":{"cited_paper":"/paper/2004.00849","citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:fd9732ee3140ea6f4c0c86617d5ad54b43a0f52408415118330863d32a28d932","observation_id":"997aa0cb-9f17-408b-b1a0-f8a892d9fe35","resolution":{"observed_at":"2026-08-11T04:32:44.256855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.204819Z","title":"A shared multi-attention framework for multi-label zero-shot learning","venue":null,"work_id":"d64c22c5-6448-4592-bfa4-83277a7b5c45","year":2020},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.260734Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:b1c5f600e4fcc13d836adbf424cc12fab0518f331f2ce0ea5788190aae4e4b8a","observation_id":"9ec5a05a-8bdd-4ae1-9026-fae029bf1a22","resolution":{"observed_at":"2026-08-11T04:32:45.208593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.193869Z","title":"Saliency-guided attention network for image-sentence matching","venue":null,"work_id":"58e4bb1d-4177-4c76-a913-da733d9723b3","year":2019},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.264069Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:985d2356eb18b5d3410d979f1bfaaddd8c952eae069019dbb620b6e7b05cb0ca","observation_id":"3fa3cc9b-d828-48df-83e3-961b39cba4ff","resolution":{"observed_at":"2026-08-11T04:32:45.197759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.268216Z","title":"Scaling up visual and vision-language representa- tion learning with noisy text supervision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.268216Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:79ecca4635c02cac1fa09c4561834f4c8020f2fbf9da13aa12bb2612f18312a0","observation_id":"686a888e-1eba-4f25-8004-13e084b54a3f","resolution":{"observed_at":"2026-08-11T04:32:44.268216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.176560Z","title":"Billion- scale similarity search with GPUs","venue":null,"work_id":"52002c82-a05b-441d-8b83-0ea220037973","year":2019},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.271625Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:244093fe3e5f92bea91bc582720f8f97b0df127d21881600876f59159b711f28","observation_id":"eafb4ef9-c241-417d-8886-47d9e74930e1","resolution":{"observed_at":"2026-08-11T04:32:45.180726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.166099Z","title":"Deep fragment embeddings for bidirectional image sentence map- ping","venue":null,"work_id":"76942500-d858-435d-8508-a2ae3bea71a0","year":2014},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.274901Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:386d81c70f61936df13d94bfc87383a56038689388372e97e23466c08a653c72","observation_id":"d8e8ddab-b78e-4966-b790-3786abc2f5d7","resolution":{"observed_at":"2026-08-11T04:32:45.169751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.278151Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.278151Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:146bb844938acffd1db5540735af4db9095e851ae4fe6d98ab1cc3dc9d49a6b9","observation_id":"21fc5f81-024b-4a2c-b6a7-7b36f78de260","resolution":{"observed_at":"2026-08-11T04:32:44.278151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1411.2539","last_updated":"2014-11-10T19:09:41Z","snapshot_observed_at":"2026-08-14T23:12:14.296355Z","submitted_at":"2014-11-10T19:09:41Z","title":"Unifying Visual-Semantic Embeddings with Multimodal Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1411.2539","snapshot_observed_at":"2026-08-11T04:32:44.281134Z","title":"Unifying visual-semantic embeddings with multimodal neu- ral language models","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.281134Z"},"links":{"cited_paper":"/paper/1411.2539","citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:85675cadb8c464d2c719356d175e7a2d79c2e0f12c077e511dc2938721316cb0","observation_id":"8a12dc4f-a81c-44cc-a008-49f6370ae8d7","resolution":{"observed_at":"2026-08-11T04:32:44.281134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.148783Z","title":"Shamma, Michael S","venue":null,"work_id":"bac1dd8d-e166-49f6-a81a-a51a7e809f23","year":2017},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.284372Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:e6f412aced08b52c7c4482d85e6351f112a15ce34c8c92a363f22bf10c9509f6","observation_id":"95c20d47-1580-4854-a49b-3dc08b8d5f11","resolution":{"observed_at":"2026-08-11T04:32:45.152272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.138178Z","title":null,"venue":null,"work_id":"3a1ccd4d-100d-4929-8108-c20eb378ecfe","year":1955},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.287351Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:014db66a0a74938bc6b001d2e6acff76f6f9efea830bf0f479dff18aea3b0b8d","observation_id":"6df81d8e-eff7-40a4-a593-cdfc267d3d75","resolution":{"observed_at":"2026-08-11T04:32:45.141789Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.127664Z","title":null,"venue":null,"work_id":"17631287-0b97-4f84-8c0c-e6f3b18fb6ae","year":2023},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.290556Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:771fb93799883e1ee4d5b5043f4b2f924ea0e2a2eeae2e9b353bd097a46d8084","observation_id":"b3b67e33-dcd7-43e6-9c36-f586355d5870","resolution":{"observed_at":"2026-08-11T04:32:45.131234Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.115930Z","title":"Temporal ensembling for semi-supervised learning","venue":null,"work_id":"9da1f81f-fad6-477f-9ac2-0a652d721b27","year":2017},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.293820Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:27cbdb5bb77d7a7804e83e418b4dc8a1ce5eb3dff1a55ef3cf69b7015d07c00d","observation_id":"60c05cb3-e6c2-405b-af93-126efa21482b","resolution":{"observed_at":"2026-08-11T04:32:45.119941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.104168Z","title":"Pseudo-label: The simple and effi- cient semi-supervised learning method for deep neural net- works","venue":null,"work_id":"48d02ee2-c257-4e08-a331-a52f93e37fff","year":2013},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.296862Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:dd1368f524909de0455ff5033851e3a338313ab46cc3eeda9d5cfab6d46110e2","observation_id":"de4c5e1e-d551-435e-a233-d19e650eb4ce","resolution":{"observed_at":"2026-08-11T04:32:45.108387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.093506Z","title":"Stacked cross attention for image-text match- ing","venue":null,"work_id":"04f6aef1-4bd8-467a-a015-1688d70bcb5a","year":2018},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.299959Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:1e1aaa23b93eaaffdb1c88200a22b5f19c9cef3907026bcdd19ec12b555221ba","observation_id":"e3ead0e3-686a-4c35-89a1-81cc86ebb2b4","resolution":{"observed_at":"2026-08-11T04:32:45.097553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.083122Z","title":"Object- centric open-vocabulary image retrieval with aggregated fea- tures","venue":null,"work_id":"a8bae8e2-4310-4a29-949a-219079de988d","year":2022},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.303233Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:f59aec88431bc54486d04ea996ffedc90ecf1f67b679509b914944333e0944ed","observation_id":"9dc3596a-371b-4a4f-9ae1-751f4c6e4a23","resolution":{"observed_at":"2026-08-11T04:32:45.086738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.062893Z","title":null,"venue":null,"work_id":"d84ba3ee-0951-40f0-94a7-5a00e22897a2","year":2023},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.310751Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:8a759832c24ef38b16712cb383506862b366463027d2d14cef21a019c1976dc3","observation_id":"146a311d-96ca-4ecb-873c-1483b1c4eb96","resolution":{"observed_at":"2026-08-11T04:32:45.066222Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.314386Z","title":"Blip: Bootstrapping language-image pre-training for uni- fied vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.314386Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:eca87d99ec0fe0b95dc2c55dafc2498ca996f7650c5a9312ee8e08c2d415f389","observation_id":"e34b8b82-f596-4a95-a4ee-346ed7268fc4","resolution":{"observed_at":"2026-08-11T04:32:44.314386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.046022Z","title":"Selvaraju, Akhilesh Gotmare, Shafiq R","venue":null,"work_id":"99e5f420-5b69-4145-a38d-ff98d2c09aac","year":2021},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.317593Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:dc4962af2ae4c5d682277a1159f92701621b4d51726bfc86e703c5333de94cb5","observation_id":"59b5766e-5fd1-4b2e-b8f9-6b2f750695a0","resolution":{"observed_at":"2026-08-11T04:32:45.050149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.03647","last_updated":"2022-04-07T17:59:38Z","snapshot_observed_at":"2026-08-15T20:49:46.773954Z","submitted_at":"2022-04-07T17:59:38Z","title":"Adapting CLIP For Phrase Localization Without Further Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.03647","snapshot_observed_at":"2026-08-11T04:32:44.321352Z","title":"Adapting clip for phrase localization without further train- ing","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.321352Z"},"links":{"cited_paper":"/paper/2204.03647","citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:1496f1fdb0f00fa2f7e7a8e37e08253a95bf28eb365550a49691c51790939523","observation_id":"fd915810-0a36-4df9-a6ea-3e382c155e70","resolution":{"observed_at":"2026-08-11T04:32:44.321352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.035524Z","title":"Visual semantic reasoning for image-text matching","venue":null,"work_id":"052faca3-9d04-42de-a96f-8e1eb601cca9","year":2019},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.325446Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:9687de1d572339a81575177f6578b3cb38a4693943a820a9c8c06d3664450ced","observation_id":"d046fad0-f1d1-480c-8022-6a12fe3da4a4","resolution":{"observed_at":"2026-08-11T04:32:45.039224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.023949Z","title":"Oscar: Object-semantics aligned pre-training for vision-language tasks","venue":null,"work_id":"ef6ebb22-9b5d-4b12-878a-4767574c6445","year":2020},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.328831Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:4cffb6214316b79febb4050d1e552bfcd68fd64b3bfef4d8d293296a91025198","observation_id":"73bd46c6-5fc3-4ab1-a26a-26cf35164df4","resolution":{"observed_at":"2026-08-11T04:32:45.028368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.893817Z","title":"Belongie, James Hays, Pietro Perona, Deva Ramanan, Piotr Doll ´ar, and C","venue":null,"work_id":"1ba15eb6-c8ae-449a-b559-38c5fbf832c6","year":2014},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.336016Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:00bea49545a656263d90d6c0d5d153951c9a5c895c241e288bad842a0fdd5a5c","observation_id":"a9d6e88f-414b-42f1-b0b8-507a899234a1","resolution":{"observed_at":"2026-08-11T04:32:44.897271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.883520Z","title":"OVIS: open-vocabulary visual instance search via visual-semantic aligned representation learning","venue":null,"work_id":"ee33ee1a-dfa8-4e71-9043-e4cb97a893ae","year":2022},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.340173Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:f2e7f07c5f2e6191c362f006371e8c55ee67f2bff1d55116cbf88ffa378a9184","observation_id":"2b349096-06b7-42cb-a4c6-9cb48cf6f698","resolution":{"observed_at":"2026-08-11T04:32:44.887428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.873680Z","title":"Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks","venue":null,"work_id":"c5a787e6-a90b-4253-95b7-2d5891b822e5","year":2019},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.343611Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:73f5454ac35048b5b8641e28fa4ab33d55714cb35a728c631f3feab3c135d604","observation_id":"16a27aa1-d413-4d77-8973-cf788d4a5f0c","resolution":{"observed_at":"2026-08-11T04:32:44.877132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.863752Z","title":"Simple open-vocabulary object detection with vi- sion transformers","venue":null,"work_id":"525b93fc-e1e2-4314-8cae-a8ed8a3dad3b","year":2022},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.347063Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:2bd8ae8cdd264f5565319b7bf81122abcf5dd38c52e00fdd3794f222b5def992","observation_id":"d94d9d91-28c5-4225-994f-2c6853b905e0","resolution":{"observed_at":"2026-08-11T04:32:44.867278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.852631Z","title":"Gritsenko, and Neil Houlsby","venue":null,"work_id":"50490b0a-a57c-49c2-a130-b341d98d14d5","year":2023},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.350738Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:c69db8759e2e6bbbb22546b70d1dcf789f33698f3cfc448fbbfc4a22cf527f6c","observation_id":"7588f2e9-508f-4bb2-a304-3e9c275e8002","resolution":{"observed_at":"2026-08-11T04:32:44.856527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.841695Z","title":null,"venue":null,"work_id":"50b1a18a-2431-4d8e-8cec-6b2fae7528cd","year":1999},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.354036Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:5d89dcb639f9d6eadab0bddb2766d6d6fc3d090205e5f4c1395e939f5e426c42","observation_id":"5bf0f9be-7dff-4b7f-8e14-5aa812923dba","resolution":{"observed_at":"2026-08-11T04:32:44.845186Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5650","last_updated":"2014-03-21T23:47:20Z","snapshot_observed_at":"2026-08-14T23:50:57.448947Z","submitted_at":"2013-12-19T17:30:31Z","title":"Zero-Shot Learning by Convex Combination of Semantic Embeddings","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5650","snapshot_observed_at":"2026-08-11T04:32:44.357178Z","title":"Zero-shot learning by convex combination of semantic embeddings","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.357178Z"},"links":{"cited_paper":"/paper/1312.5650","citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:a908ef55b5137ba794a7baab29548eff500d4b4e6c0a42c0f8c5b485414cd90e","observation_id":"09142528-ce7a-4f0b-ac31-6b5639a54405","resolution":{"observed_at":"2026-08-11T04:32:44.357178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.831150Z","title":"Meta pseudo labels","venue":null,"work_id":"225abe3e-6c45-473b-b876-73eede8ceb46","year":2021},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.361301Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:2528308516bedc6330b6c4a1ff8c2c2abcb2905a68ce98a3bd3287e392bd76ec","observation_id":"1fc4f01e-9860-440f-ae21-fb0089197ab5","resolution":{"observed_at":"2026-08-11T04:32:44.834732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.819947Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"bfbbb309-de34-4c7e-9bbd-da85b51ad22b","year":2021},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.364047Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:40af764116a3faa65d5721abe9c461456f38aab5c4c7a9ed07971d84d30f562d","observation_id":"3fa9b5d8-4ad4-4319-8180-845013a1315b","resolution":{"observed_at":"2026-08-11T04:32:44.823825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.809165Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"23f07da8-4463-4779-ba1a-75544467ee75","year":2021},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.366883Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:3e003f20cf5007e60a620f9416be236cc345965dea2b3b70c8b30679ba8c7b2b","observation_id":"8279678d-be3a-4a0f-907b-8b02f10f7380","resolution":{"observed_at":"2026-08-11T04:32:44.812922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.797723Z","title":"Denseclip: Language-guided dense prediction with context- aware prompting","venue":null,"work_id":"f04108ec-ed55-4d92-95e4-b684366bd32f","year":2022},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.369964Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:05e0f982727997e45acc3203a00b721725f8d6dbf88dd983d54883d096b22ff6","observation_id":"32507526-2ecc-4074-846f-32b1062fe148","resolution":{"observed_at":"2026-08-11T04:32:44.802015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.372916Z","title":"Regularization with stochastic transformations and perturba- tions for deep semi-supervised learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.372916Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:97b3a1e0634443241c5591d69c61e37a42c5da13dd759034df5cde5338940940","observation_id":"344bb416-94ed-4c4b-afe8-07253d2c8211","resolution":{"observed_at":"2026-08-11T04:32:44.372916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.779995Z","title":"Objects365: A large-scale, high-quality dataset for object detection","venue":null,"work_id":"346f145b-dcf6-4386-b831-79a2044ffb24","year":2019},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.376152Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:4105f2542dc09d33a657bcfdd7b1d0cd5f4c00981bd5c619b4510027b9e58541","observation_id":"f9390e8f-d0e3-4351-a377-a724965289cc","resolution":{"observed_at":"2026-08-11T04:32:44.783806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.379094Z","title":"Fixmatch: Simplifying semi-supervised learning with consistency and confidence","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.379094Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:960effbcf5257e568babbf3c8f3d1a56404e0cb87c3be4b4468c5d359afea96d","observation_id":"709102e8-1cd6-4c97-8075-a6903002902b","resolution":{"observed_at":"2026-08-11T04:32:44.379094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.04757","last_updated":"2020-12-03T04:12:25Z","snapshot_observed_at":"2026-08-09T05:19:02.818950Z","submitted_at":"2020-05-10T19:15:51Z","title":"A Simple Semi-Supervised Learning Framework for Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.04757","snapshot_observed_at":"2026-08-11T04:32:44.381983Z","title":"A simple semi-supervised learning framework for object detection","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.381983Z"},"links":{"cited_paper":"/paper/2005.04757","citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:8ff3c337d1948dbc0edf434998b8c28f5b615c473f179784708a68e5446fac2a","observation_id":"0a9d0bf0-888d-426d-89a1-2fc076229288","resolution":{"observed_at":"2026-08-11T04:32:44.381983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.762087Z","title":"Dualcoop: Fast adaptation to multi-label recognition with limited annotations","venue":null,"work_id":"0c8c5c53-dbcd-4f5e-a0ba-6b35f14fcd04","year":2022},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.385620Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:1c04d5e1fdfb1696f908541ac3b631131b69bd8c993d958e8f6680d399aa2b06","observation_id":"ea46336a-b1d4-4448-9650-8cdf05a0cf7b","resolution":{"observed_at":"2026-08-11T04:32:44.765945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.751417Z","title":"LXMERT: learning cross- modality encoder representations from transformers","venue":null,"work_id":"c3710603-027f-4e18-bd22-4c0c8d1417bd","year":2019},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.388942Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:49659acc8a427778764452ce07ad64dc6868458700368d08b769614d7d0ca455","observation_id":"4b43bf7a-9756-4073-aead-773778dcfe73","resolution":{"observed_at":"2026-08-11T04:32:44.755377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.740238Z","title":"GIT: A generative image-to-text transformer for vision and language","venue":null,"work_id":"4064926a-739c-4e4d-a2be-9e4dbc008547","year":2022},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.392434Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:b6a02d5b79a6551e83c77f378fdbe4771c6d0928bf6ff84630d158919950a20a","observation_id":"c7ad6b8d-16d5-47a5-a1e2-e70438683180","resolution":{"observed_at":"2026-08-11T04:32:44.744179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.729598Z","title":"Object-aware dis- tillation pyramid for open-vocabulary object detection","venue":null,"work_id":"d6d4e53d-481e-4f92-9464-7be49ceb1e54","year":2023},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.395836Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:4ac3cee839bcb0e662b3cebb3fe03bcfb4be951660660b532121a7901b550a80","observation_id":"ef0f87d3-b8a2-405e-a4c5-f16b7fdc7551","resolution":{"observed_at":"2026-08-11T04:32:44.733306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.399222Z","title":"Simvlm: Simple visual language model pretraining with weak supervision","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.399222Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:19ce236233a6c415b90b0bd8dd21802d460bd9fec8e6b11d401021a13c745a56","observation_id":"a81d8b9c-e971-4e63-a19f-8ba16a6494e7","resolution":{"observed_at":"2026-08-11T04:32:44.399222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.712755Z","title":"Aligning bag of regions for open- vocabulary object detection","venue":null,"work_id":"31740eee-bda7-41e7-85b0-53e4ecd811b9","year":2023},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.402977Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:11996ea6c36d099da304bb68de56ccf97c4df615bf6331ff248f937c6e0ff43f","observation_id":"49996732-0701-4f2d-9d60-70578c39dc16","resolution":{"observed_at":"2026-08-11T04:32:44.716100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.702951Z","title":"CLIPSelf: Vision transformer distills itself for open-vocabulary dense predic- tion","venue":null,"work_id":"8678d3c2-30f1-450b-82a3-106b8f501ed3","year":2024},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.406238Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:ab7cbfae7306736e1336554ff9454332930a03fe4cec23920974164ed382a1cf","observation_id":"498f067e-e35f-4230-8853-ecb759bcd7db","resolution":{"observed_at":"2026-08-11T04:32:44.706543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.692722Z","title":"CLIM: contrastive language-image mosaic for region representation","venue":null,"work_id":"ded4e684-ba29-4eb9-9126-12a8d63a9463","year":2024},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.409651Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:8f4237ef821f03d20ca79e8748d3aab8c83919d6e6d6106b69f4bb6105900348","observation_id":"81b8bdef-5eb0-46d9-9bba-cabc7ba1b374","resolution":{"observed_at":"2026-08-11T04:32:44.696334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.682787Z","title":"CORA: adapting CLIP for open-vocabulary detection with region prompting and anchor pre-matching","venue":null,"work_id":"2f830d69-ed6a-46f8-b1fe-a4ffc81e58d3","year":2023},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.412748Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:4dd13d619ed0a68fc4d3c23fd125d9918dafdd3a67f6a7198d5a50525fd61a96","observation_id":"580337d6-a7cf-4fc9-b58b-182f5997df2c","resolution":{"observed_at":"2026-08-11T04:32:44.686378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.673211Z","title":"Unsupervised data augmentation for consistency training","venue":null,"work_id":"7fe94f48-65e6-4a26-828e-3b16a12b5ef8","year":2020},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.415985Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:acc719f020ac90405ba990bbaa590f8f9cc70b31af37576b958a5030a7ed861c","observation_id":"700ef036-57bb-4c77-ab99-8e0878c5917f","resolution":{"observed_at":"2026-08-11T04:32:44.676599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.663353Z","title":"Self-training with noisy student improves imagenet classification","venue":null,"work_id":"e623ac99-3f69-44d8-aa05-6adc421dc4d4","year":2020},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.419323Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:c19e2b8b6aa83ea65e60112c3af7a6ba1a7d25c45c6b5a378a802310d5541452","observation_id":"b744b86f-6194-4436-b81d-dd6704429373","resolution":{"observed_at":"2026-08-11T04:32:44.666904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.654059Z","title":"From image descriptions to visual denotations: New similarity metrics for semantic inference over event descrip- tions","venue":null,"work_id":"c6698bdb-05e7-46ed-959b-2c11b9f95f52","year":2014},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.422649Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:77283df43c357051ec231695c16823c3372e4d471c6a1c389e08406186d685e9","observation_id":"048912da-d9df-44e4-b709-f355f2b41bd4","resolution":{"observed_at":"2026-08-11T04:32:44.657502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.644064Z","title":"Coca: Contrastive captioners are image-text foundation models","venue":null,"work_id":"3a2f3dab-b7cf-45a3-8dbc-f7f71f8b6ee4","year":2022},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.426262Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:bee7296a9007dadcc2d9a462ef4b3bbc058b3dfaf85b1afe96db3569a242de14","observation_id":"bd62beab-7379-4888-8130-214531072f82","resolution":{"observed_at":"2026-08-11T04:32:44.647759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-08-11T04:32:44.429626Z","title":"Florence: A new foundation model for computer vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.429626Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:59c93c10be61fad3e146ac8dc6c1a37b272a87cfcb1f9f264e2c9f5be94822a4","observation_id":"b4d89a9c-6988-460f-b56c-92e848b601fd","resolution":{"observed_at":"2026-08-11T04:32:44.429626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.634170Z","title":"Lit: Zero-shot transfer with locked-image text tuning","venue":null,"work_id":"41851213-8623-4934-9b71-eed4a43f7ec8","year":2022},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.433395Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:130ee02ebfe532bb6c480fae80f0bbab857a4d4b6a8f0a9caf44b7bd20a3724b","observation_id":"d208642c-8131-4507-af4f-51998798543d","resolution":{"observed_at":"2026-08-11T04:32:44.637917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.623722Z","title":"Fast zero- shot image tagging","venue":null,"work_id":"97d1d89f-6264-4c35-9755-fc2509fab5f0","year":2016},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.436720Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:dbdaff6763ce7b5ee1300ce12304b37c859fa082160135302ad52dbdae5b9e1c","observation_id":"ef404a21-badb-4213-b54b-cac7d18684fa","resolution":{"observed_at":"2026-08-11T04:32:44.627313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.612658Z","title":"Exploiting unlabeled data with vision and language models for object detection","venue":null,"work_id":"3e4a155b-b827-4131-93c6-ad9b67058724","year":2022},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.439922Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:15eacf4ae486df552fe4631007ac0ded36d374f90a107fb0fd0563aa2fa04ad2","observation_id":"ee36940d-78f8-4565-a92f-1b331c27776f","resolution":{"observed_at":"2026-08-11T04:32:44.616505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.601808Z","title":"Regionclip: Region-based language-image pretraining","venue":null,"work_id":"b61b4e01-6545-4a97-b4d4-9f94830d1450","year":2022},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.443115Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:1a6e485ce0da7a69e31f27517293a7b5e363889f90a3438016a1591c41da3ebc","observation_id":"e2e330fd-2ab1-4fbe-94ce-3da4a3e6a41e","resolution":{"observed_at":"2026-08-11T04:32:44.605565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.590554Z","title":"Extract free dense labels from CLIP","venue":null,"work_id":"60b2c7a2-845b-4487-b7c7-192cdcf16359","year":2022},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.446293Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:32f254082645f9deb7222764fb4da80bd151eb9146c35811175374b724136fc0","observation_id":"b62ee730-0a93-42a7-87f4-f0bb529cb6f6","resolution":{"observed_at":"2026-08-11T04:32:44.594224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.579731Z","title":"Detecting twenty-thousand classes using image-level supervision","venue":null,"work_id":"f22d69c3-60ed-4b7e-b260-1a387226a850","year":2022},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.449513Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:3000e7c17fd58c8d9ad9e57b8a68dcb6afe630c4692bcfff9212b66ce506ec48","observation_id":"eb1e4021-4501-4b31-ad38-015d563c7db8","resolution":{"observed_at":"2026-08-11T04:32:44.583536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.569525Z","title":"Semi-supervised learning literature survey","venue":null,"work_id":"3b9813e7-1fb1-4b42-a31d-676975b4ffc2","year":2005},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.452756Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:c144df40d2089891738302fd5a949bc53a4a9c78858a16e79283aa0f5154a64f","observation_id":"95111b72-017c-45d8-bace-6ee30db8b557","resolution":{"observed_at":"2026-08-11T04:32:44.573034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.557491Z","title":"Rethinking pre- training and self-training","venue":null,"work_id":"23312b2c-a39b-4874-9499-791f804730ed","year":2020},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.456090Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:031ca73e1ff4ecc5dda51a6d4f8c52d3fc5b5ce1631783e2d30decb18fc984ec","observation_id":"351aa591-742d-4d2d-89d0-32ec6b46c002","resolution":{"observed_at":"2026-08-11T04:32:44.562509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.545975Z","title":null,"venue":null,"work_id":"f8575864-5472-4969-b898-6130d3ac39da","year":null},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.459932Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:5a717386dec9a59e364b648b8982056c7194ec0b479681a2050cc11b5428522c","observation_id":"e59c07a9-5278-4433-89ee-a27e483a05aa","resolution":{"observed_at":"2026-08-11T04:32:44.550453Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.903544Z","title":null,"venue":null,"work_id":"2cf10949-9764-4f0c-9a89-f8058a8b8a5a","year":2020},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":137,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.332198Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:ddeabbd479b1c245afd89feafdded4cef895bd3c864944807b90d9dbe513f980","observation_id":"bf8ebb87-d2c6-425d-a6f2-0de489193ef3","resolution":{"observed_at":"2026-08-11T04:32:44.906987Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:45.072608Z","title":"1, 2, 3, 4, 6, 8, 13","venue":null,"work_id":"f186bcd1-1b7d-4b3b-a4f2-ae69e426e69e","year":2023},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":608,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.307277Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:81117da8de8e9586acb34eb84e02a373a3e915c893834c8f148d6bf9a70a78b9","observation_id":"c7121743-9217-492c-aba3-3e4c4fe05e1a","resolution":{"observed_at":"2026-08-11T04:32:45.076156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:44.180725Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval","version":1},"reference_index":6086,"source":"pdf_text","source_observed_at":"2026-08-11T04:32:44.180725Z"},"links":{"citing_paper":"/paper/2412.18806"},"observation_digest":"sha256:a0c2fb11d5cad2a3703906a47f0c48f6bac478065b3665b1a2518bb03c9a6c70","observation_id":"17f61c72-0b65-4ef8-9c9d-831b1e11f4cd","resolution":{"observed_at":"2026-08-11T04:32:44.180725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.18806","last_updated":"2024-12-25T07:08:51Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T02:21:53.624772Z","submitted_at":"2024-12-25T07:08:51Z","title":"FOR: Finetuning for Object Level Open Vocabulary Image Retrieval"},"reference_resolution":{"displayed":85,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":22,"verified_exact":0,"verified_fuzzy":61},"total_outbound_references":85},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 85 of 85 outbound references and 0 inbound Pith citation observations for arXiv:2412.18806."}