{"as_of":"2026-08-09T22:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0117c2787d21c0d71218d928e94b95cdf853c21176dd670ad236cf2d7a772894","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T23:35:25.173917Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.05053/citation-record","integrity":"/paper/2508.05053/integrity","json":"/paper/2508.05053/citation-record.json","paper":"/paper/2508.05053"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:30.095565Z","title":null,"venue":null,"work_id":"d39a72f3-1995-41ac-845f-d31163c71091","year":2024},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-08T05:00:22.796967Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:20.244853Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:3643eb266a045d1fd2c9b65178a0e098f6e85d68ef3a7731ee2bf39ed8bbab75","observation_id":"82dbdc11-b18e-449e-8d1b-19383a72f44b","resolution":{"observed_at":"2026-08-05T23:35:30.309238Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:29.664559Z","title":null,"venue":null,"work_id":"df8ce1d2-ab74-43b6-90f5-4ba66d8e4915","year":2019},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-08T05:00:22.796967Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:20.285941Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:3f93c19c333efb45dcaa32c6bc589d5818c165a5589023aeb27aa55b35729bbc","observation_id":"6d224883-9e8b-4f0a-b5c6-96fe499bbfe6","resolution":{"observed_at":"2026-08-05T23:35:29.902978Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04952","last_updated":"2024-11-07T18:29:38Z","snapshot_observed_at":"2026-07-06T19:46:54.707852Z","submitted_at":"2024-11-07T18:29:38Z","title":"M3DocRAG: Multi-modal Retrieval is What You Need for Multi-page Multi-document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04952","snapshot_observed_at":"2026-08-05T23:35:20.389650Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-08T05:00:22.796967Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:20.389650Z"},"links":{"cited_paper":"/paper/2411.04952","citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:959fd0d7471eda85613455fdd06a7076c198d79465dd4cf238fc8823a70be575","observation_id":"87a50d81-abf0-42b3-a340-a0dc3d45a918","resolution":{"observed_at":"2026-08-05T23:35:20.389650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:20.486664Z","title":null,"venue":null,"work_id":null,"year":1960},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-08T05:00:22.796967Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:20.486664Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:6a6ccb94b4404d25c2b76361f4f7beb0cf41120d6163253677e9bdb6de214259","observation_id":"46efde8f-0e17-43bc-a7dd-f06f8e2f351b","resolution":{"observed_at":"2026-08-05T23:35:20.486664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:29.589078Z","title":null,"venue":null,"work_id":"02514ebf-813a-4c9d-a7ee-6f8e63614ae9","year":2023},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-08T05:00:22.796967Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:20.538611Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:75287b728278458fc2f6028c8967cd918da10220815c32b3c54d2c3850177de5","observation_id":"5dc35908-269d-4e01-828b-bbed0b3b50bd","resolution":{"observed_at":"2026-08-05T23:35:29.658124Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:29.418919Z","title":null,"venue":null,"work_id":"197bb508-b62b-4e1c-9629-f3cc80297774","year":2022},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-08T05:00:22.796967Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:20.610408Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:94ebb26ec8b0c065bf00bee1898d625387da54b838f14df042639e368894a768","observation_id":"34233fc9-7d9a-46f6-a221-a72bce537185","resolution":{"observed_at":"2026-08-05T23:35:29.514661Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01449","last_updated":"2025-02-28T08:51:57Z","snapshot_observed_at":"2026-07-06T18:39:43.472708Z","submitted_at":"2024-06-27T15:45:29Z","title":"ColPali: Efficient Document Retrieval with Vision Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01449","snapshot_observed_at":"2026-08-05T23:35:20.787317Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-08T05:00:22.796967Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:20.787317Z"},"links":{"cited_paper":"/paper/2407.01449","citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:1a93d0b84158f6ac75184b92d60df5428f57f9cec77909a684194d4d8669500e","observation_id":"9cc6d07a-e823-4d2d-915f-49635d2a9322","resolution":{"observed_at":"2026-08-05T23:35:20.787317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:29.260765Z","title":null,"venue":null,"work_id":"dee09474-a49d-4922-ad74-ce9577b62c51","year":2022},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-08T05:00:22.796967Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:20.897000Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:e250be29bc8744d402ef19a2da01d71be0a2224bbb69e9a216a1f222d58f6dda","observation_id":"c95bb920-0913-41d8-a0e4-f9fdd81e7c75","resolution":{"observed_at":"2026-08-05T23:35:29.347631Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:29.120639Z","title":null,"venue":null,"work_id":"6acff27b-8c03-4088-ba92-8b6181a1bc3e","year":2024},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-08T05:00:22.796967Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:20.984880Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:788bfb43696669d766295b31885ada8753cae13aecf4d2a93bd7a5d96eb9d116","observation_id":"e62940b5-1f3d-4d2e-9891-8b34700bb39e","resolution":{"observed_at":"2026-08-05T23:35:29.168569Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-05T23:35:21.080509Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-08T05:00:22.796967Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:21.080509Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:e5339fb8211136b16a2d42ac930e9e6367ac988e39e9145b26d2efd836d868c1","observation_id":"522f5dce-3315-47c8-be80-dc5bdc3b5c7c","resolution":{"observed_at":"2026-08-05T23:35:21.080509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:28.985498Z","title":null,"venue":null,"work_id":"445abde0-23a3-4d9c-bc96-dcf6470f069e","year":2022},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-08T05:00:22.796967Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:21.137744Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:0de00e1430cb081e11bce6524d71d50c2758bc96eb496895f8cb9c72b12ab463","observation_id":"01e4be79-5a70-4742-b9fb-ca8d11a41ed5","resolution":{"observed_at":"2026-08-05T23:35:29.064662Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:28.864346Z","title":null,"venue":null,"work_id":"6cde79fb-0b11-4dee-b705-5397ce2f57ac","year":2022},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-08T05:00:22.796967Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:21.227566Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:16dab4e1f60de28041854dfa7ca79c7d1ad9b4e019de8bebeb0ead3f2beb6770","observation_id":"09985699-a226-4ae7-8cbd-88012fdca6f5","resolution":{"observed_at":"2026-08-05T23:35:28.918534Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00231","last_updated":"2024-06-02T15:47:16Z","snapshot_observed_at":"2026-07-06T17:37:52.514730Z","submitted_at":"2024-03-01T02:21:30Z","title":"Multimodal ArXiv: A Dataset for Improving Scientific Comprehension of Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00231","snapshot_observed_at":"2026-08-05T23:35:21.414530Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-08T05:00:22.796967Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:21.414530Z"},"links":{"cited_paper":"/paper/2403.00231","citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:e3f651f34b899d1828a704d8ab1e7fe5766ec7df0cd1c1430982cade5fb06f7b","observation_id":"5f894236-9082-4dc2-b385-e47f7738b3c1","resolution":{"observed_at":"2026-08-05T23:35:21.414530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20271","last_updated":"2025-02-22T14:02:39Z","snapshot_observed_at":"2026-08-09T18:37:19.036481Z","submitted_at":"2024-03-29T16:26:20Z","title":"Draw-and-Understand: Leveraging Visual Prompts to Enable MLLMs to Comprehend What You Want","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20271","snapshot_observed_at":"2026-08-05T23:35:21.467830Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-08T05:00:22.796967Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:21.467830Z"},"links":{"cited_paper":"/paper/2403.20271","citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:8b6e0ce5ff20e3065a52bf9c5069c62b89d1c7a55bf6194b93ec24d0739c859b","observation_id":"13065974-bb15-4c14-9943-db6377dce38b","resolution":{"observed_at":"2026-08-05T23:35:21.467830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:28.706092Z","title":"Mmlongbench-doc: Benchmarking long-context document understanding with visualizations","venue":null,"work_id":"6be97746-bf3e-4dd2-b182-cfa74bcc205a","year":null},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-08T05:00:22.796967Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:21.607416Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:229add8552a9949d1994846b3ded2ebb53caa8eecac8be7815a16a033a32ad3c","observation_id":"07cfc3b5-6a7b-432d-8d83-b645631efede","resolution":{"observed_at":"2026-08-05T23:35:28.781940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:28.556614Z","title":null,"venue":null,"work_id":"d20e9971-0e92-432b-8c24-d057789e29c6","year":2022},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-08T05:00:22.796967Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:21.721552Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:fe2ecd2f95b9dc52697a149ff628d166f3efb2d6dbf3a841650532ca101898c9","observation_id":"2a59277a-367d-4c3e-bb88-aa449140ff51","resolution":{"observed_at":"2026-08-05T23:35:28.634216Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:28.427347Z","title":null,"venue":null,"work_id":"31c4b655-3cdb-46c0-8238-adc4b283d9b6","year":2022},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-08T05:00:22.796967Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:21.832382Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:4efa3e98e9f2152901ac44690b8111890973a6fb5f1539481a9bdbd9f90dea46","observation_id":"18e3a403-11bf-4bc8-937d-6e45c0ed0cf4","resolution":{"observed_at":"2026-08-05T23:35:28.488916Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:28.273609Z","title":null,"venue":null,"work_id":"b0484ec6-a1bd-4eba-bb7d-cf3722e0c410","year":2021},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-08T05:00:22.796967Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:21.924530Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:3dec20dd73c83fe2d25ae637667aea5edb5837dc154a978b3b68c210f448cdcf","observation_id":"b3c1ef78-9245-4a3b-a084-1da184c7d5d0","resolution":{"observed_at":"2026-08-05T23:35:28.326339Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:28.138553Z","title":null,"venue":null,"work_id":"408386e5-8626-4551-bfea-1b8d3b6e345c","year":2020},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-08T05:00:22.796967Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:22.026645Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:2363c10399ff448c4b0722c30a70f4944b0732f5642e28b20705591a56f5fd08","observation_id":"b8d4260d-ebac-41da-b355-ddfc5f0a9ced","resolution":{"observed_at":"2026-08-05T23:35:28.202919Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:27.964625Z","title":null,"venue":null,"work_id":"eb07fdd4-d5bc-4d70-a690-894ac88e16fc","year":2019},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-08T05:00:22.796967Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:22.100000Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:586da7fedb566ca6299b606d6fa1276b16d4521dc308c5f1b19dec2d4e1c191a","observation_id":"79b932e2-8c9f-4d39-8cd7-3e43b5924196","resolution":{"observed_at":"2026-08-05T23:35:28.034220Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T23:35:22.191685Z","title":"Goucher, Adam Perelman, and Aditya Ramesh et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-08T05:00:22.796967Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:22.191685Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:0b369d266143a403731348297dd4caf6232f4d3880e2bd1ec23af3e86a5902e7","observation_id":"97d8ed9e-4f9b-4616-bdbd-9cca7b23be39","resolution":{"observed_at":"2026-08-05T23:35:22.191685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T23:35:22.298121Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-08T05:00:22.796967Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:22.298121Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:a462124b5c407d91bda97edbf395e34c980c9e32219804698832dc9432caf6f3","observation_id":"89dde69a-4cec-442c-bcbc-ba97be1c9996","resolution":{"observed_at":"2026-08-05T23:35:22.298121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:27.809387Z","title":null,"venue":null,"work_id":"756f1c06-0f90-4ad5-9a15-aab448f010f7","year":2019},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-08T05:00:22.796967Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:22.376901Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:f31868fab3fdfb57ffbc49d7a0e4b6234f331a6147ba8bc8eb7b7c21b5c82bab","observation_id":"fb02c845-f51b-467c-bd88-4b6001ae67a0","resolution":{"observed_at":"2026-08-05T23:35:27.872777Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-05T23:35:22.469669Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-08T05:00:22.796967Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:22.469669Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:9505f00900316de075aeeda373635401008489ae3e422a0ca4af0d774c9ebceb","observation_id":"a4013ee6-a8b4-406c-8e8c-39713b6b4194","resolution":{"observed_at":"2026-08-05T23:35:22.469669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:27.658317Z","title":"Spiqa: A dataset for multimodal question answering on scientific papers","venue":null,"work_id":"8fd661af-20cd-40fc-9dc5-b13e1bcffea8","year":null},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-08T05:00:22.796967Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:22.611508Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:6210dbd5222751a52e848286c39a33181dddfd4501acf4941bc19d22808a130a","observation_id":"4e83e174-5e44-459e-bdba-3d103f5173d7","resolution":{"observed_at":"2026-08-05T23:35:27.739681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.05250","last_updated":"2016-10-11T02:42:36Z","snapshot_observed_at":"2026-08-08T11:05:45.903773Z","submitted_at":"2016-06-16T16:36:00Z","title":"SQuAD: 100,000+ Questions for Machine Comprehension of Text","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.05250","snapshot_observed_at":"2026-08-05T23:35:22.717154Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-08T05:00:22.796967Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:22.717154Z"},"links":{"cited_paper":"/paper/1606.05250","citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:7d4a6637daecb6987dee59dff502becff2d1f2164559df1e75c6bec3ed441408","observation_id":"2f20d3f4-5a59-4989-8b0b-295849c0e625","resolution":{"observed_at":"2026-08-05T23:35:22.717154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06712","last_updated":"2023-08-18T05:49:47Z","snapshot_observed_at":"2026-07-06T15:15:26.125395Z","submitted_at":"2023-04-13T17:58:08Z","title":"What does CLIP know about a red circle? Visual prompt engineering for VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06712","snapshot_observed_at":"2026-08-05T23:35:22.821052Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-08T05:00:22.796967Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:22.821052Z"},"links":{"cited_paper":"/paper/2304.06712","citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:c4a6f900be81deaa605e9d9dd4df0ebb0d30416feb647cb3d3f20acd72acd0e9","observation_id":"15dba7cd-b3ed-4867-80aa-c3808a26b4e3","resolution":{"observed_at":"2026-08-05T23:35:22.821052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:27.489367Z","title":null,"venue":null,"work_id":"a0cf4396-67bc-47bd-b796-cdf2bab3a2ab","year":2007},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-08T05:00:22.796967Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:22.897960Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:c208eaafc587ad8a8c0c226057263b3912439c51bcb9a927bb0dd8e0740f0562","observation_id":"56cce215-07d6-48b1-a750-d9c33ee9cb77","resolution":{"observed_at":"2026-08-05T23:35:27.584949Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:27.349184Z","title":null,"venue":null,"work_id":"688dccc4-a95c-446b-bba4-451809aac987","year":1992},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-08T05:00:22.796967Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:22.998680Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:1ed2ab7fc263a99f323d218801babc493ab828fa379d1bfedbc39e406d675e88","observation_id":"3239c2b4-0e12-4edc-8b4a-4e98c52d680f","resolution":{"observed_at":"2026-08-05T23:35:27.409168Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13534","last_updated":"2021-02-04T23:48:39Z","snapshot_observed_at":"2026-08-07T03:26:44.455151Z","submitted_at":"2020-11-27T03:05:59Z","title":"A Survey of Deep Learning Approaches for OCR and Document Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13534","snapshot_observed_at":"2026-08-05T23:35:23.100123Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-08T05:00:22.796967Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:23.100123Z"},"links":{"cited_paper":"/paper/2011.13534","citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:58b3c9b41587faacf065a492bb85daddc2c6645d88924d310b81a953831886f7","observation_id":"715fac83-a4bd-49ed-a6ca-aad5898a213e","resolution":{"observed_at":"2026-08-05T23:35:23.100123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:27.200265Z","title":null,"venue":null,"work_id":"076a35a1-c39d-488c-85ee-628b5023e29f","year":2023},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-08T05:00:22.796967Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:23.210141Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:7452a9dbb99548bff9e447030c594c92a54cb72b91dff70d5a1b200fc8ca6393","observation_id":"80365c97-d878-4b54-bace-776cfebe81fd","resolution":{"observed_at":"2026-08-05T23:35:27.264942Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T23:35:23.347496Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-08T05:00:22.796967Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:23.347496Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:0456674a09e82d2995d48b3b0534332ea606d3b5c16438d7be15aedf6bb43baf","observation_id":"de30a918-02cf-4ffa-95cf-0086a95985ea","resolution":{"observed_at":"2026-08-05T23:35:23.347496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-05T23:35:23.442044Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-08T05:00:22.796967Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:23.442044Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:04bab4f9ae9c68e1a1f4adb12badb7ad8f5c88b7902edff4d2498bdeb4885ba4","observation_id":"bb4e2654-478f-4b5e-8dd1-146be7088218","resolution":{"observed_at":"2026-08-05T23:35:23.442044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:26.970093Z","title":null,"venue":null,"work_id":"6db3d27b-1d18-4c7e-86ba-16f7803bcac7","year":2023},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-08T05:00:22.796967Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:23.539460Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:f683f5f847a566a189407bd2f2b6eed63ef338d0b163cbdd117ba85196fb715c","observation_id":"3932e7dc-6f99-4b4b-b003-d58628c713e2","resolution":{"observed_at":"2026-08-05T23:35:27.082133Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:26.801663Z","title":null,"venue":null,"work_id":"b0279ed6-9ac7-43b6-b485-eebb96c77ae2","year":2023},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-08T05:00:22.796967Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:23.662824Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:20ce68342a438b4a4f41fd81282a6d1626e9802144ee5a066ed4065188c73b80","observation_id":"5667cccb-486b-4a5c-8768-814baa7bfe19","resolution":{"observed_at":"2026-08-05T23:35:26.881051Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T23:35:23.749223Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-08T05:00:22.796967Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:23.749223Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:7ec12455eac24ec879d0d3c0271f7e0536c0ede07593e176661902cfe3666248","observation_id":"31faf26f-33e9-4cbc-b772-23fc3d3b49cf","resolution":{"observed_at":"2026-08-05T23:35:23.749223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:23.842456Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-08T05:00:22.796967Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:23.842456Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:a495ea7ae279222d4964f863f1f4ff36ac7ebcf6159e7fe62371b51649b4de13","observation_id":"fa7289b6-e2d6-4dcd-8973-d93dff57f0a2","resolution":{"observed_at":"2026-08-05T23:35:23.842456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1703.07195","last_updated":"2019-08-05T09:20:50Z","snapshot_observed_at":"2026-08-02T15:58:38.617198Z","submitted_at":"2017-03-21T12:57:58Z","title":"GP-GAN: Towards Realistic High-Resolution Image Blending","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.07195","snapshot_observed_at":"2026-08-05T23:35:23.935125Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-08T05:00:22.796967Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:23.935125Z"},"links":{"cited_paper":"/paper/1703.07195","citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:069c41e562d81b7d110a5c15c9ec553957b34bf6da5e9792ad3d78271338cfe6","observation_id":"17ae7c1d-ea98-4c51-9236-c54e1d6a87bc","resolution":{"observed_at":"2026-08-05T23:35:23.935125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15310","last_updated":"2024-09-05T08:47:34Z","snapshot_observed_at":"2026-08-05T20:59:08.258366Z","submitted_at":"2024-09-05T08:47:34Z","title":"Visual Prompting in Multimodal Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15310","snapshot_observed_at":"2026-08-05T23:35:24.104443Z","title":"Rossi, Ruiyi Zhang, Subrata Mitra, Dimitris N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-08T05:00:22.796967Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:24.104443Z"},"links":{"cited_paper":"/paper/2409.15310","citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:70b17158f3a981e22f3cc2feae8e44543f67f29cb499184483f9fa9e57185f90","observation_id":"d7e906a8-9839-4d82-9328-c67c32ea5419","resolution":{"observed_at":"2026-08-05T23:35:24.104443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:26.474680Z","title":null,"venue":null,"work_id":"3f48a98a-0723-431f-a181-2db0299dd596","year":2022},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-08T05:00:22.796967Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:24.203022Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:671bbd1a02db68a9d4608d5aca74c42e5f0ebb7182e070352e012edb5d9b5630","observation_id":"617c0b01-3c34-4b7d-882b-ed5ed3007145","resolution":{"observed_at":"2026-08-05T23:35:26.640637Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.14740","last_updated":"2022-01-10T04:08:10Z","snapshot_observed_at":"2026-07-06T10:28:31.555048Z","submitted_at":"2020-12-29T13:01:52Z","title":"LayoutLMv2: Multi-modal Pre-training for Visually-Rich Document Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.14740","snapshot_observed_at":"2026-08-05T23:35:24.345477Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-08T05:00:22.796967Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:24.345477Z"},"links":{"cited_paper":"/paper/2012.14740","citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:0e4d3191e37648ce20de3f700ba3b1576a2ee232077eb797ee4bc378dfd81384","observation_id":"67f6bfd6-7632-4801-9fc8-fadf8f7056cd","resolution":{"observed_at":"2026-08-05T23:35:24.345477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:26.083697Z","title":null,"venue":null,"work_id":"37e4553b-a0c7-402a-9688-8fd4aade519c","year":2020},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-08T05:00:22.796967Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:24.483863Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:e807b9d4e8a24244b3bfeca3cdcfc57fab196ad10057a8b50a4144823ce47ab8","observation_id":"118b3bff-0267-44b2-97e2-2dc878d34ee7","resolution":{"observed_at":"2026-08-05T23:35:26.300469Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04356","last_updated":"2023-12-12T06:36:53Z","snapshot_observed_at":"2026-08-02T18:09:02.754027Z","submitted_at":"2023-06-07T11:39:56Z","title":"Fine-Grained Visual Prompting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04356","snapshot_observed_at":"2026-08-05T23:35:24.630084Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-08T05:00:22.796967Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:24.630084Z"},"links":{"cited_paper":"/paper/2306.04356","citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:cacd225eea1f9fc7c5aea211d44e6fb844d1610511dbef37f5c710c14f971020","observation_id":"a86b2a0a-2453-4902-842a-d989ba82ebcf","resolution":{"observed_at":"2026-08-05T23:35:24.630084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15343","last_updated":"2023-09-27T12:05:41Z","snapshot_observed_at":"2026-07-06T15:08:30.190912Z","submitted_at":"2023-03-27T15:53:01Z","title":"Sigmoid Loss for Language Image Pre-Training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15343","snapshot_observed_at":"2026-08-05T23:35:24.756157Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-08T05:00:22.796967Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:24.756157Z"},"links":{"cited_paper":"/paper/2303.15343","citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:92b6fb112409e7b1d575de0d081202a60ae062aeda8bbacf1256e1f962ee0828","observation_id":"bdca3ade-8e0d-473f-b4b4-7df56c1fe871","resolution":{"observed_at":"2026-08-05T23:35:24.756157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00816","last_updated":"2024-08-14T07:26:08Z","snapshot_observed_at":"2026-07-06T17:38:17.853302Z","submitted_at":"2024-02-26T01:17:50Z","title":"Read and Think: An Efficient Step-wise Multimodal Language Model for Document Understanding and Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00816","snapshot_observed_at":"2026-08-05T23:35:24.850312Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-08T05:00:22.796967Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:24.850312Z"},"links":{"cited_paper":"/paper/2403.00816","citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:106e3a34c0e0b482a30ac4720b92219df40b635caffc9a8b1d11bd57c5136553","observation_id":"62327dcb-40d3-49b5-9c7d-b367369e0bd4","resolution":{"observed_at":"2026-08-05T23:35:24.850312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:25.782009Z","title":null,"venue":null,"work_id":"16c436d7-451f-40dd-9410-824f28d9b7dd","year":2024},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-08T05:00:22.796967Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:24.943908Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:6425c2fcbfa365d3f4296946cef87fabd7cb5299683119e8d14b749322789df2","observation_id":"e33a3e28-3024-4fd4-88ca-7e9f9149c5a0","resolution":{"observed_at":"2026-08-05T23:35:25.947300Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:25.480450Z","title":null,"venue":null,"work_id":"98af6cbb-415b-44d4-8b5f-90c98602f224","year":2022},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-08T05:00:22.796967Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:25.029604Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:570f9645956ae9e3ab46a090f32bc0dd95bd29bf8e67bb652d0c0baa8668a06e","observation_id":"c72d0b6d-19cb-43fd-94f6-eddb14b119ab","resolution":{"observed_at":"2026-08-05T23:35:25.628034Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:25.090842Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-08T05:00:22.796967Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:25.090842Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:5a6e96e4b076622cfc738f3eb950e5bceb9484a29b9f604e250ab91fb8ccb1d5","observation_id":"d5d1c8f2-7e0d-4368-bbf2-431acae88700","resolution":{"observed_at":"2026-08-05T23:35:25.090842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:35:25.173917Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","snapshot_observed_at":"2026-08-08T05:00:22.796967Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-05T23:35:25.173917Z"},"links":{"citing_paper":"/paper/2508.05053"},"observation_digest":"sha256:00b5bd8f20908029f0bcad75496fb0dc69f6e8e40f2583b03ee55d3c29c9f20b","observation_id":"aa444793-eac9-403d-afff-0415020a5266","resolution":{"observed_at":"2026-08-05T23:35:25.173917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.05053","last_updated":"2025-08-07T06:10:15Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T05:00:22.796967Z","submitted_at":"2025-08-07T06:10:15Z","title":"Finding Needles in Images: Can Multimodal LLMs Locate Fine Details?"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":47,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 0 inbound Pith citation observations for arXiv:2508.05053."}