{"as_of":"2026-08-09T02:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9d3732cb14c0bd66033ab4e9718f9577e80f3303eb7eb47d559bd05407a6fad8","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":8,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":8,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T13:35:05.146089Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.00977","last_updated":"2024-10-14T23:15:24Z","snapshot_observed_at":"2026-07-06T18:24:09.535762Z","submitted_at":"2024-06-03T04:17:12Z","title":"Dragonfly: Multi-Resolution Zoom-In Encoding Enhances Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2406.00977","doi":"10.48550/arxiv.2406.00977","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.00977","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dragonfly: Multi-resolution zoom-in encoding enhances vision-language models","venue":"arXiv (Cornell University)","work_id":"7e0c9c20-1f24-4f35-bf57-aee6d5c08598","year":2024},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":105,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"cited_paper":"/paper/2406.00977","citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:e5ad2eccf91c272b24d15d4b03345d357b1d0a08ad34ec5f1294b49b6978f25a","observation_id":"4c1de7a1-5708-4282-846f-1656ee8c09e0","resolution":{"observed_at":"2026-05-15T01:55:12.690324Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-22T13:22:40.552135+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T13:22:40.552135+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00977","last_updated":"2024-10-14T23:15:24Z","snapshot_observed_at":"2026-07-06T18:24:09.535762Z","submitted_at":"2024-06-03T04:17:12Z","title":"Dragonfly: Multi-Resolution Zoom-In Encoding Enhances Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00977","snapshot_observed_at":"2026-08-08T13:35:05.146089Z","title":"L., and Zou, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07838","last_updated":"2025-02-13T11:13:14Z","snapshot_observed_at":"2026-08-08T13:29:20.075129Z","submitted_at":"2025-02-11T02:31:45Z","title":"NanoVLMs: How small can we go and still make coherent Vision Language Models?","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T13:35:05.146089Z"},"links":{"cited_paper":"/paper/2406.00977","citing_paper":"/paper/2502.07838"},"observation_digest":"sha256:0624d8be6fd7cf76fdd77ebccae1ffe7c7da59e5be7449184a9e1853cf6f9e4d","observation_id":"bd7a9c8b-04b3-46e6-acee-abd39ef0c37d","resolution":{"observed_at":"2026-08-08T13:35:05.146089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00977","last_updated":"2024-10-14T23:15:24Z","snapshot_observed_at":"2026-07-06T18:24:09.535762Z","submitted_at":"2024-06-03T04:17:12Z","title":"Dragonfly: Multi-Resolution Zoom-In Encoding Enhances Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2406.00977","doi":"10.48550/arxiv.2406.00977","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.00977","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dragonfly: Multi-resolution zoom-in encoding enhances vision-language models","venue":"arXiv (Cornell University)","work_id":"7e0c9c20-1f24-4f35-bf57-aee6d5c08598","year":2024},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-08-08T20:11:45.308315Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"cited_paper":"/paper/2406.00977","citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:e5f5833694135b5f17905b5e9b4a33810525341c6fd5260b65f15bb1c536540a","observation_id":"54ded20d-c61f-4f0d-afe0-acdd9efd7b58","resolution":{"observed_at":"2026-05-13T01:13:57.522812Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-22T13:22:40.552135+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T13:22:40.552135+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00977","last_updated":"2024-10-14T23:15:24Z","snapshot_observed_at":"2026-07-06T18:24:09.535762Z","submitted_at":"2024-06-03T04:17:12Z","title":"Dragonfly: Multi-Resolution Zoom-In Encoding Enhances Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00977","snapshot_observed_at":"2026-08-07T14:13:53.620718Z","title":"Dragonfly: Multi-resolution zoom supercharges large visual-language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19611","last_updated":"2025-05-26T07:27:18Z","snapshot_observed_at":"2026-08-07T14:08:12.836653Z","submitted_at":"2025-05-26T07:27:18Z","title":"Align and Surpass Human Camouflaged Perception: Visual Refocus Reinforcement Fine-Tuning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:53.620718Z"},"links":{"cited_paper":"/paper/2406.00977","citing_paper":"/paper/2505.19611"},"observation_digest":"sha256:7b39269784c78ec9497db8aaf4222877a478ded992b2ffb146a1b2ad848ecb9b","observation_id":"c9c35a3a-e7ab-49b8-82e2-6924501282f5","resolution":{"observed_at":"2026-08-07T14:13:53.620718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00977","last_updated":"2024-10-14T23:15:24Z","snapshot_observed_at":"2026-07-06T18:24:09.535762Z","submitted_at":"2024-06-03T04:17:12Z","title":"Dragonfly: Multi-Resolution Zoom-In Encoding Enhances Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00977","snapshot_observed_at":"2026-08-07T04:47:07.644114Z","title":"Dragonfly: Multi-Resolution Zoom Supercharges Large Visual-Language Model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-07T04:41:01.082936Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.644114Z"},"links":{"cited_paper":"/paper/2406.00977","citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:149890d2d040da5d1bbb49a0f07af1f069ff50a2bf5c3f280d64b0fe6964f22c","observation_id":"95305907-eca2-414a-9d4f-20ead735841f","resolution":{"observed_at":"2026-08-07T04:47:07.644114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00977","last_updated":"2024-10-14T23:15:24Z","snapshot_observed_at":"2026-07-06T18:24:09.535762Z","submitted_at":"2024-06-03T04:17:12Z","title":"Dragonfly: Multi-Resolution Zoom-In Encoding Enhances Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00977","snapshot_observed_at":"2026-08-07T04:57:50.493602Z","title":"Dragonfly: Multi-resolution zoom-in encoding enhances vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14821","last_updated":"2025-08-05T03:49:33Z","snapshot_observed_at":"2026-08-07T05:00:44.806379Z","submitted_at":"2025-06-10T20:11:44Z","title":"Reinforcing VLMs to Use Tools for Detailed Visual Reasoning Under Resource Constraints","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T04:57:50.493602Z"},"links":{"cited_paper":"/paper/2406.00977","citing_paper":"/paper/2506.14821"},"observation_digest":"sha256:7c04042294f710ae32f6f939bc6b12dd23dbcdbec0418c6936d0153dc48efa87","observation_id":"4370f78f-ad7e-460a-afac-bbb72edbc717","resolution":{"observed_at":"2026-08-07T04:57:50.493602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00977","last_updated":"2024-10-14T23:15:24Z","snapshot_observed_at":"2026-07-06T18:24:09.535762Z","submitted_at":"2024-06-03T04:17:12Z","title":"Dragonfly: Multi-Resolution Zoom-In Encoding Enhances Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2406.00977","doi":"10.48550/arxiv.2406.00977","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.00977","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dragonfly: Multi-resolution zoom-in encoding enhances vision-language models","venue":"arXiv (Cornell University)","work_id":"7e0c9c20-1f24-4f35-bf57-aee6d5c08598","year":2024},"citing_paper":{"arxiv_id":"2605.07019","last_updated":"2026-05-07T23:03:21Z","snapshot_observed_at":"2026-07-06T23:19:25.538514Z","submitted_at":"2026-05-07T23:03:21Z","title":"LensVLM: Selective Context Expansion for Compressed Visual Representation of Text","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-11T01:09:01.612988Z"},"links":{"cited_paper":"/paper/2406.00977","citing_paper":"/paper/2605.07019"},"observation_digest":"sha256:6af9b41ad8621586638d8a1cf1a923d82a601ed00700d53bbf2c49e2e4bd91fd","observation_id":"c563a569-7719-4c6a-a3a1-304bf844b4e4","resolution":{"observed_at":"2026-05-11T04:41:00.029294Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-22T13:22:40.552135+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T13:22:40.552135+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00977","last_updated":"2024-10-14T23:15:24Z","snapshot_observed_at":"2026-07-06T18:24:09.535762Z","submitted_at":"2024-06-03T04:17:12Z","title":"Dragonfly: Multi-Resolution Zoom-In Encoding Enhances Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2406.00977","doi":"10.48550/arxiv.2406.00977","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.00977","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dragonfly: Multi-resolution zoom-in encoding enhances vision-language models","venue":"arXiv (Cornell University)","work_id":"7e0c9c20-1f24-4f35-bf57-aee6d5c08598","year":2024},"citing_paper":{"arxiv_id":"2605.22098","last_updated":"2026-05-21T07:36:00Z","snapshot_observed_at":"2026-08-07T21:34:22.734861Z","submitted_at":"2026-05-21T07:36:00Z","title":"TextTeacher: What Can Language Teach About Images?","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-22T07:26:03.594414Z"},"links":{"cited_paper":"/paper/2406.00977","citing_paper":"/paper/2605.22098"},"observation_digest":"sha256:5ab9e6faa139795f72dde784f41782b24831e04f02c36105d12477c3c67bfe60","observation_id":"efe94f43-145d-4253-9e29-de71d652dc03","resolution":{"observed_at":"2026-05-22T07:26:12.686085Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-22T13:22:40.552135+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T13:22:40.552135+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2406.00977/citation-record","integrity":"/paper/2406.00977/integrity","json":"/paper/2406.00977/citation-record.json","paper":"/paper/2406.00977"},"outbound":[],"paper":{"arxiv_id":"2406.00977","last_updated":"2024-10-14T23:15:24Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T18:24:09.535762Z","submitted_at":"2024-06-03T04:17:12Z","title":"Dragonfly: Multi-Resolution Zoom-In Encoding Enhances Vision-Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 8 inbound Pith citation observations for arXiv:2406.00977."}