{"as_of":"2026-08-10T20:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7a745acad0b889cc810a8cc05d295d8c85bfdf712cee133e9daeb2236dd5c380","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:27:31.900376Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.24441/citation-record","integrity":"/paper/2505.24441/integrity","json":"/paper/2505.24441/citation-record.json","paper":"/paper/2505.24441"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:35.367335Z","title":"X-detr: A versatile architecture for instance-wise vision-language tasks","venue":null,"work_id":"da18e7d3-58f3-42b0-b57b-71b8a9d8675a","year":2022},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-10T16:30:38.499649Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:27.762549Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:64d82b8019c697674c2a58abe577086dfa2f85c717c9014ee595a71eed4b56ed","observation_id":"5acbcf90-cf7e-4d06-b3de-ba888e6a9bfb","resolution":{"observed_at":"2026-08-07T12:27:35.456632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:27.837332Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-10T16:30:38.499649Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:27.837332Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:f235b7ab0a6ba622199f8717ec5ddd54e1173bc05279c2a01343641258370161","observation_id":"f32e6da4-2021-479b-9e9e-fcaa91e5a35b","resolution":{"observed_at":"2026-08-07T12:27:27.837332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:35.127865Z","title":"Learning local similarity with spatial relations for object retrieval","venue":null,"work_id":"91a6bcdb-d0c2-420f-9e97-4480e47919af","year":2019},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-10T16:30:38.499649Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:27.933126Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:221dec9b3a9ce44001a9118aea1fe249c98301955dd6beb1b15e5fbb4dd41a02","observation_id":"9387a1d4-f76b-4651-820f-fe0187b64db0","resolution":{"observed_at":"2026-08-07T12:27:35.249664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T12:27:28.026719Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling.arXiv preprint arXiv:2412.05271, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-10T16:30:38.499649Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:28.026719Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:053d373434a6bc7d26f35e88cf112ef8b8236089ecd512c3fc813b244c1691cf","observation_id":"082977d1-44db-463c-a5ba-4a4e62f6ed8b","resolution":{"observed_at":"2026-08-07T12:27:28.026719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:28.128917Z","title":"Qlora: Efficient finetuning of quantized llms.Advances in neural information processing systems, 36:10088– 10115, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-10T16:30:38.499649Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:28.128917Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:d6ea657fdb6bcea0f17d859f122cefcfefffe5bfa920ea2aad2a805aac22f5f9","observation_id":"5bd15887-e3ae-427e-90c2-d45e6b7eaf93","resolution":{"observed_at":"2026-08-07T12:27:28.128917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-07T12:27:28.204348Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models.arXiv preprint arXiv:2306.13394, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-10T16:30:38.499649Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:28.204348Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:8071580ee5b2fd4a17e2a07d9c2baf3ed01f82f3d58fc6742574332eeb99bd1b","observation_id":"d3838025-9c10-4428-a4b3-b08ff2acc72b","resolution":{"observed_at":"2026-08-07T12:27:28.204348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:28.295713Z","title":"Efficient diffusion on region manifolds: Recovering small objects with compact cnn representations","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-10T16:30:38.499649Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:28.295713Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:e1250791b837e6936e1bcfec975d3cdd9c0ae97d9d9301de3930b0569dc84c9d","observation_id":"afb5e2b4-a51b-438a-b829-241e933bcf21","resolution":{"observed_at":"2026-08-07T12:27:28.295713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:28.391753Z","title":"Scaling sen- tence embeddings with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-10T16:30:38.499649Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:28.391753Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:876ebddb2e55ade2317ee3c94493f1e36ee688e13da2d27d577ac127098c858f","observation_id":"75a1b733-ddb9-48e8-8168-a90b202f97b9","resolution":{"observed_at":"2026-08-07T12:27:28.391753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12580","last_updated":"2024-07-17T14:04:12Z","snapshot_observed_at":"2026-08-05T07:40:31.916436Z","submitted_at":"2024-07-17T14:04:12Z","title":"E5-V: Universal Embeddings with Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12580","snapshot_observed_at":"2026-08-07T12:27:28.457180Z","title":"E5-v: Universal embeddings with multimodal large language models.arXiv preprint arXiv:2407.12580, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-10T16:30:38.499649Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:28.457180Z"},"links":{"cited_paper":"/paper/2407.12580","citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:e92eaf1e25857cc09959081b743946c4e0b444cd6d8478bf7b4bec9404546005","observation_id":"f1d3f6d5-968a-4429-a8d9-9bdfe5c71934","resolution":{"observed_at":"2026-08-07T12:27:28.457180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:28.549834Z","title":"Seed-bench: Benchmarking multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-10T16:30:38.499649Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:28.549834Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:dbc2f1b47f6c03423c43143cf57b7731fb11e1154d0ef6f7bca88360847c59ae","observation_id":"786e7fc5-0611-43ba-bb1d-80d72bde548b","resolution":{"observed_at":"2026-08-07T12:27:28.549834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:34.912894Z","title":"Llava-next: What else influences visual instruction tuning beyond data?, 2024","venue":null,"work_id":"b78912f1-cb57-4f82-9847-f7d972d2cb19","year":2024},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-10T16:30:38.499649Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:28.617327Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:860e497fba0a6183d810468fbc49cbc8a04c3960eda77310a1dfa0dc125d1971","observation_id":"fb7b339f-9a49-46f0-8d2b-a784f67123e2","resolution":{"observed_at":"2026-08-07T12:27:35.003420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:28.735559Z","title":"Llava-next: Stronger llms supercharge multimodal capabilities in the wild, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-10T16:30:38.499649Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:28.735559Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:62f7df94782cda6a23969b4b463085cc107d59788a1c600ffba5ad395d0a8cc8","observation_id":"b6a7c232-f9ac-420e-b419-9c6133a1cad1","resolution":{"observed_at":"2026-08-07T12:27:28.735559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:34.721939Z","title":"Percep- tual generative adversarial networks for small object detection","venue":null,"work_id":"92887e75-972e-4586-9a96-0d0af059ca71","year":2017},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-10T16:30:38.499649Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:28.794418Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:700f91aef9848af02420f9f49092693cb555ec12aa8cad1703bad9300dc5d411","observation_id":"8a0f6620-4a1f-4694-a4de-327eb677aca7","resolution":{"observed_at":"2026-08-07T12:27:34.804899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:34.566960Z","title":"MM-EMBED: UNIVERSAL MULTIMODAL RETRIEV AL WITH MULTIMODAL LLMS","venue":null,"work_id":"ccc751cd-b52a-48e0-b641-c1fe6a2e2c05","year":2025},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-10T16:30:38.499649Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:28.868805Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:88ae56d4e80a42e17067b8926a33546cda4a894f697e39197de7a82bd38e6b6f","observation_id":"035a3965-b246-4700-9d7a-e32a1707cc87","resolution":{"observed_at":"2026-08-07T12:27:34.608257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:34.461223Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"150047ad-cc6c-45f0-b3d2-464022d7b6eb","year":2014},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-10T16:30:38.499649Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:28.979561Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:1462cf9824d5fcafc68059f4bd35f2a22a62e4baa7a39946c9b41ca9544f6969","observation_id":"0493bd73-1f8f-4ed4-aa54-f3031d0d9c89","resolution":{"observed_at":"2026-08-07T12:27:34.513467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:29.076060Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-10T16:30:38.499649Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:29.076060Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:8294089be7df877543338fee7e2a5579253543f8a9cab585ae896e7121007dc4","observation_id":"afa3afed-c927-4c34-902d-16570e92d1ec","resolution":{"observed_at":"2026-08-07T12:27:29.076060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:29.154729Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-10T16:30:38.499649Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:29.154729Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:f43264c928096275f845883e93377a012f9ad9ee7211c36c8fbb5fd4d5f6a6ee","observation_id":"faecee95-0ffa-43cf-a949-802bba27e520","resolution":{"observed_at":"2026-08-07T12:27:29.154729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01720","last_updated":"2024-12-02T17:10:16Z","snapshot_observed_at":"2026-08-09T15:27:00.367861Z","submitted_at":"2024-12-02T17:10:16Z","title":"LamRA: Large Multimodal Model as Your Advanced Retrieval Assistant","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01720","snapshot_observed_at":"2026-08-07T12:27:29.242591Z","title":"Lamra: Large multimodal model as your advanced retrieval assistant.arXiv preprint arXiv:2412.01720, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-10T16:30:38.499649Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:29.242591Z"},"links":{"cited_paper":"/paper/2412.01720","citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:f8f8f42332ddbac143b5e4610febccb3c48cae7708651282337e87bee5215747","observation_id":"08c2aaaa-3685-479d-929b-8fa04af701f0","resolution":{"observed_at":"2026-08-07T12:27:29.242591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:29.376486Z","title":"Mmbench: Is your multi-modal model an all-around player? InEuropean conference on computer vision, pages 216–233","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-10T16:30:38.499649Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:29.376486Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:4039ec2684aa6a07c8eb2b6349e267b211d20a953152f3f92a191a496ed56c60","observation_id":"9e4d2ed3-ca1e-4ae3-ba0d-261cb8c01d88","resolution":{"observed_at":"2026-08-07T12:27:29.376486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:34.268994Z","title":"Image retrieval on real-life images with pre-trained vision-and-language models","venue":null,"work_id":"19d2d1b7-2f4f-4987-9cc9-4592a24160fd","year":2021},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-10T16:30:38.499649Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:29.463564Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:e0c5ea34fe42e951c77300140ee8a2941ca113a4af88de11a32cc52a153c2544","observation_id":"4a131a72-e5dd-401f-b056-33755cf988e6","resolution":{"observed_at":"2026-08-07T12:27:34.327250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:29.576850Z","title":"Scaling open-vocabulary object detection.Advances in Neural Information Processing Systems, 36:72983–73007, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-10T16:30:38.499649Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:29.576850Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:e5dc9026125321d05328347f6fd76201a26b0260470bbd686c19d25cfb7e026d","observation_id":"d92e25eb-5287-4d27-96fa-15c807dd1afe","resolution":{"observed_at":"2026-08-07T12:27:29.576850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:34.091682Z","title":"Better to follow, follow to be better: Towards precise supervision of feature super-resolution for small object detection","venue":null,"work_id":"78185015-4c99-44a6-a67b-89f7fd474a7c","year":2019},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-10T16:30:38.499649Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:29.748307Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:b2ae3ae282375ccd649e04d9994de5c19441d32873e82e6d8c1c74d8b829f098","observation_id":"fb909ef7-ae4a-41d8-93d6-8ffaeb99cdef","resolution":{"observed_at":"2026-08-07T12:27:34.192178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:33.942622Z","title":"Docci: Descriptions of connected and contrasting images","venue":null,"work_id":"f8d83fbf-8a15-48d2-97ba-4c94f262d255","year":2024},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-10T16:30:38.499649Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:29.838548Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:45d3a3375beaab4b6bd23610e24433982a556b67998b6f8f63300cffe23cb453","observation_id":"b4ff8d53-7421-40ef-9996-2c15b562cfd0","resolution":{"observed_at":"2026-08-07T12:27:34.006100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04378","last_updated":"2025-05-08T19:16:29Z","snapshot_observed_at":"2026-07-06T20:02:21.509050Z","submitted_at":"2024-12-05T17:54:27Z","title":"VladVA: Discriminative Fine-tuning of LVLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04378","snapshot_observed_at":"2026-08-07T12:27:29.993325Z","title":"Discriminative fine-tuning of lvlms.arXiv preprint arXiv:2412.04378, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-10T16:30:38.499649Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:29.993325Z"},"links":{"cited_paper":"/paper/2412.04378","citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:f3fe1efc3ed3091220e060768d595691380ae1af7f0b5a4a493a37cbd555a888","observation_id":"f75c1ba7-8550-4fc1-8cae-28f0ebf1bd75","resolution":{"observed_at":"2026-08-07T12:27:29.993325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:30.084532Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-10T16:30:38.499649Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:30.084532Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:a2a25f95e6239390c75059c40037dd55921a8298b894e5540b80a0d712d61dd3","observation_id":"05149fda-196f-4cae-89cc-2e2e14a27fca","resolution":{"observed_at":"2026-08-07T12:27:30.084532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:33.771081Z","title":"Dino-x: A unified vision model for open-world object detection and understanding, 2024","venue":null,"work_id":"0b987e44-fcd8-40be-bb7c-e1dfa87515db","year":2024},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-10T16:30:38.499649Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:30.158337Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:cd51ba45b80e8fbeb79041331936dbdae96a70c2d6dd4f48ef8746216b59e053","observation_id":"31ce158a-37cc-406d-bdd9-18a8a77ad55c","resolution":{"observed_at":"2026-08-07T12:27:33.867265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:33.606067Z","title":"Small-object sensitive segmentation using across feature map attention.IEEE transactions on pattern analysis and machine intelligence, 45(5):6289–6306, 2022","venue":null,"work_id":"951ea910-d26b-4179-bd7f-e1cfb564aef2","year":2022},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-10T16:30:38.499649Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:30.248229Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:d655e0c2da2ea9e2b66a7bcd4e6c9a4d22de6f8d1e700026864d7c081d15ea5b","observation_id":"c8a04ad2-a163-4499-bcc0-a5353dcccade","resolution":{"observed_at":"2026-08-07T12:27:33.693837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:33.439618Z","title":"Image retrieval for image- based localization revisited","venue":null,"work_id":"cdf2d0f6-1019-4d26-9117-f173f88a0e4b","year":2012},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-10T16:30:38.499649Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:30.352962Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:13cf21b3dca779dd11b4f8eafd6709b472801bb19f5054198c55b332ab11c0e1","observation_id":"35b687a2-3862-4606-8873-612e4c0291a6","resolution":{"observed_at":"2026-08-07T12:27:33.502070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-07T12:27:30.439237Z","title":"Eva-clip: Improved training techniques for clip at scale.arXiv preprint arXiv:2303.15389, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-10T16:30:38.499649Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:30.439237Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:e30a2ba1034737c120b8977f37ec6846cc594411ac27b7ba9569a6881948a8c7","observation_id":"855e13de-0145-4680-bb36-e5ec5006213c","resolution":{"observed_at":"2026-08-07T12:27:30.439237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:33.295599Z","title":"Miss detection vs","venue":null,"work_id":"0d2be7c8-5958-4d3e-a66a-975630596d4b","year":2019},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-10T16:30:38.499649Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:30.520532Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:eb201bda2acd73825de9d88513bcfdcd66dd39218c70c0d7c2390824e0baaf50","observation_id":"2be028a4-f85b-4b14-8ddc-729dfe973335","resolution":{"observed_at":"2026-08-07T12:27:33.379077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:33.158126Z","title":"Improving text embeddings with large language models","venue":null,"work_id":"3cc80819-85b6-41fc-b53b-95545d224c97","year":2024},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-10T16:30:38.499649Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:30.642548Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:ba92a37d1c01f8bf662227171f2559c2b17398107a8b3c3e40487e737d9cc631","observation_id":"098cba67-c06a-4240-8829-9ea0945a0440","resolution":{"observed_at":"2026-08-07T12:27:33.219619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:30.759861Z","title":"Uniir: Training and benchmarking universal multimodal information retrievers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-10T16:30:38.499649Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:30.759861Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:1e7a0998c7f0d4a2912323a25bd2f7ace357e7c43f43c94d78f5c00a7a461685","observation_id":"98227880-d02f-49b8-9879-a12f90142d59","resolution":{"observed_at":"2026-08-07T12:27:30.759861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:30.838873Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-10T16:30:38.499649Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:30.838873Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:33940faa6397e8e940b62ff3db21147151f62dfaea2e81617722c4be5abe1cd8","observation_id":"379019e9-0448-49de-9fb1-cf557d1cecf0","resolution":{"observed_at":"2026-08-07T12:27:30.838873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:32.900052Z","title":"Described object detection: Liberating object detection with flexible expressions.Advances in Neural Information Processing Systems, 36:79095–79107, 2023","venue":null,"work_id":"db1eacf4-c5b7-4009-859a-44ca4093ac8f","year":2023},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-10T16:30:38.499649Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:30.903267Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:bdca922af52ce78da02e85072f1ffe24783c4a2ac49c2a6492043b459cfb19a0","observation_id":"485bf210-903f-4d24-a5f7-c2ce8ff02b0f","resolution":{"observed_at":"2026-08-07T12:27:33.008238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:32.694893Z","title":"Querydet: Cascaded sparse query for accelerating high-resolution small object detection","venue":null,"work_id":"fb24d4c5-df67-49af-bbb9-864434d4a9ea","year":2022},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-10T16:30:38.499649Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:30.987407Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:43d603d8b36e5d7c22338876981b4c9ed37ea54d4095d35f29f66ddc96f8a4c1","observation_id":"805ce06b-6f2a-4379-bf0c-632ad6d7b6dd","resolution":{"observed_at":"2026-08-07T12:27:32.813662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:31.099504Z","title":"From image descriptions to visual denotations: New similarity metrics for semantic inference over event descriptions","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-10T16:30:38.499649Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:31.099504Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:c18dcc3e4be00d1468abc7f5fa6934418d31a01c672e1efcfc764a6068bfbf7e","observation_id":"036e2909-c154-4e1e-8401-ca7a96da7bc7","resolution":{"observed_at":"2026-08-07T12:27:31.099504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:31.173327Z","title":"Modeling context in referring expressions","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-10T16:30:38.499649Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:31.173327Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:f9c4d9ff7fa56d714ed64d16ed510432d0badd80bfa8e8fc450dd117bdf06cd3","observation_id":"cd9e4d0e-0d54-4216-8cfa-e18dac7098e2","resolution":{"observed_at":"2026-08-07T12:27:31.173327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:31.311495Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-10T16:30:38.499649Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:31.311495Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:bf7e04b247fcc1114adc47762808097bd249fff194a6f5dbeb04a1c54b179119","observation_id":"eb48f2dc-991f-4d69-8861-9f1063a0235e","resolution":{"observed_at":"2026-08-07T12:27:31.311495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:31.530724Z","title":"Long-clip: Unlocking the long-text capability of clip","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-10T16:30:38.499649Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:31.530724Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:f5792dd29d99ef3d8e7d937c7002ffe126c09273fcabad3a5783fdb0d15e263f","observation_id":"513f8cbf-138c-4b0c-b682-9822fcc6700c","resolution":{"observed_at":"2026-08-07T12:27:31.530724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:31.647153Z","title":"A simple framework for open-vocabulary segmentation and detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-10T16:30:38.499649Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:31.647153Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:c02565284a690fba14655960ca3fef2beae3a0bed3565628fc0195d45abbf152","observation_id":"2d6ac876-1bf0-4d7e-b860-dea9d3e4042e","resolution":{"observed_at":"2026-08-07T12:27:31.647153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16855","last_updated":"2025-04-01T08:48:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-22T04:40:24Z","title":"GME: Improving Universal Multimodal Retrieval by Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16855","snapshot_observed_at":"2026-08-07T12:27:31.738988Z","title":"Gme: Improving universal multimodal retrieval by multimodal llms.arXiv preprint arXiv:2412.16855, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-10T16:30:38.499649Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:31.738988Z"},"links":{"cited_paper":"/paper/2412.16855","citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:29bc373c487dfeb78b08a190e98d8a1d475553d2a68df08a5423f4e509c9d440","observation_id":"69637d68-5504-445c-a0b9-8cbbb00a66ce","resolution":{"observed_at":"2026-08-07T12:27:31.738988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:32.371988Z","title":"Vista: Visualized text embedding for universal multi-modal retrieval","venue":null,"work_id":"6cb94b59-d8fc-4641-aec1-0332c2544851","year":2024},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-10T16:30:38.499649Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:31.818367Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:074377c40bb0e24fcd8cc66bdeb7bcbc80f1a2540894ba10a94346b3e6ee75ae","observation_id":"14c5c1ac-78b0-4090-b9b3-0fa678ce33bd","resolution":{"observed_at":"2026-08-07T12:27:32.534564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:27:32.196590Z","title":"Summarize the [main component/ background/ detail] in the above image in one word:","venue":null,"work_id":"c6f49bb8-b1aa-4e81-9295-67ecd8150084","year":2023},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-10T16:30:38.499649Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:31.900376Z"},"links":{"citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:41bfa2dc2b45fdaedb1568827af5c464ef40bf2f529d92da4acd4f7b5704500d","observation_id":"7d8cf7c5-6a1f-411d-9632-00d2e5fea2cb","resolution":{"observed_at":"2026-08-07T12:27:32.235066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T16:30:38.499649Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":18},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2505.24441."}