{"as_of":"2026-08-12T21:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ab30ec569e46865a329ae38f9104b1f4d222d0ac9e4530a59f40605ae6218019","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T13:38:48.718208Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-03T21:20:00.041277Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T21:28:58.415452Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.12940","last_updated":"2024-12-17T14:18:50Z","snapshot_observed_at":"2026-08-11T13:32:16.151433Z","submitted_at":"2024-12-17T14:18:50Z","title":"Improving Fine-grained Visual Understanding in VLMs through Text-Only Training","version":1},"cited_work":{"arxiv_id":"2412.12940","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.12940","snapshot_observed_at":"2026-07-03T21:28:58.415452Z","title":null,"venue":null,"work_id":"1d788b85-4ab5-45cf-9a25-f1f8cd904ef0","year":2024},"citing_paper":{"arxiv_id":"2604.20665","last_updated":"2026-05-21T08:47:56Z","snapshot_observed_at":"2026-08-06T16:05:08.769769Z","submitted_at":"2026-04-22T15:15:32Z","title":"The Expense of Seeing: Attaining Trustworthy Multimodal Reasoning Within the Monolithic Paradigm","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-09T23:56:02.856878Z"},"links":{"cited_paper":"/paper/2412.12940","citing_paper":"/paper/2604.20665"},"observation_digest":"sha256:e8f9bdad7a13528b56d4601e8b9ce05a2431503faba945362e906ac0afaa9569","observation_id":"f4f61ac8-4882-48ed-8eae-3bf6c8df07b5","resolution":{"observed_at":"2026-05-11T13:51:05.108698Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12940","last_updated":"2024-12-17T14:18:50Z","snapshot_observed_at":"2026-08-11T13:32:16.151433Z","submitted_at":"2024-12-17T14:18:50Z","title":"Improving Fine-grained Visual Understanding in VLMs through Text-Only Training","version":1},"cited_work":{"arxiv_id":"2412.12940","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.12940","snapshot_observed_at":"2026-07-03T21:28:58.415452Z","title":null,"venue":null,"work_id":"1d788b85-4ab5-45cf-9a25-f1f8cd904ef0","year":2024},"citing_paper":{"arxiv_id":"2604.20665","last_updated":"2026-05-21T08:47:56Z","snapshot_observed_at":"2026-08-06T16:05:08.769769Z","submitted_at":"2026-04-22T15:15:32Z","title":"The Expense of Seeing: Attaining Trustworthy Multimodal Reasoning Within the Monolithic Paradigm","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T10:35:50.838150Z"},"links":{"cited_paper":"/paper/2412.12940","citing_paper":"/paper/2604.20665"},"observation_digest":"sha256:8a6a9300e9f084baee1148e4a0e0a039512fd4d561e29081856a132e680e6ef0","observation_id":"4591128f-01c6-41d4-91b5-7adcbe14be72","resolution":{"observed_at":"2026-05-22T10:36:25.017520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12940","last_updated":"2024-12-17T14:18:50Z","snapshot_observed_at":"2026-08-11T13:32:16.151433Z","submitted_at":"2024-12-17T14:18:50Z","title":"Improving Fine-grained Visual Understanding in VLMs through Text-Only Training","version":1},"cited_work":{"arxiv_id":"2412.12940","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.12940","snapshot_observed_at":"2026-07-03T21:28:58.415452Z","title":null,"venue":null,"work_id":"1d788b85-4ab5-45cf-9a25-f1f8cd904ef0","year":2024},"citing_paper":{"arxiv_id":"2607.02089","last_updated":"2026-07-01T14:25:43Z","snapshot_observed_at":"2026-08-02T16:57:02.105465Z","submitted_at":"2026-07-01T14:25:43Z","title":"ESC: Emotional Self-Correction for Reliable Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-03T21:20:00.041277Z"},"links":{"cited_paper":"/paper/2412.12940","citing_paper":"/paper/2607.02089"},"observation_digest":"sha256:1d107fc03333eae22881f14e7d3353e62f2c5234e129f36fb2b07e5dd6b79426","observation_id":"8786e51c-aef8-47c0-9dcb-f02a802a4832","resolution":{"observed_at":"2026-07-03T21:28:58.416837Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.12940/citation-record","integrity":"/paper/2412.12940/integrity","json":"/paper/2412.12940/citation-record.json","paper":"/paper/2412.12940"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-11T13:38:48.419921Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.12940","last_updated":"2024-12-17T14:18:50Z","snapshot_observed_at":"2026-08-11T13:32:16.151433Z","submitted_at":"2024-12-17T14:18:50Z","title":"Improving Fine-grained Visual Understanding in VLMs through Text-Only Training","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:48.419921Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2412.12940"},"observation_digest":"sha256:8163eb8e995dfbc6f124a9eaf6803a8c5f44743fa039f065bd1995b417887a79","observation_id":"f692c8d6-53e4-471b-b6b3-4483b6121e35","resolution":{"observed_at":"2026-08-11T13:38:48.419921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-11T13:38:48.424361Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.12940","last_updated":"2024-12-17T14:18:50Z","snapshot_observed_at":"2026-08-11T13:32:16.151433Z","submitted_at":"2024-12-17T14:18:50Z","title":"Improving Fine-grained Visual Understanding in VLMs through Text-Only Training","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:48.424361Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2412.12940"},"observation_digest":"sha256:192322c906750530cf236ae8cd478691cca4cb48a6b54f1f5b7df9b76f3b80e8","observation_id":"8abb1fdc-6ca9-497d-817c-3b9a83c9aa5a","resolution":{"observed_at":"2026-08-11T13:38:48.424361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16469","last_updated":"2025-05-30T05:58:03Z","snapshot_observed_at":"2026-08-08T08:09:49.413831Z","submitted_at":"2024-06-24T09:18:15Z","title":"Evaluating Visual and Cultural Interpretation: The K-Viscuit Benchmark with Human-VLM Collaboration","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16469","snapshot_observed_at":"2026-08-11T13:38:48.427892Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12940","last_updated":"2024-12-17T14:18:50Z","snapshot_observed_at":"2026-08-11T13:32:16.151433Z","submitted_at":"2024-12-17T14:18:50Z","title":"Improving Fine-grained Visual Understanding in VLMs through Text-Only Training","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:48.427892Z"},"links":{"cited_paper":"/paper/2406.16469","citing_paper":"/paper/2412.12940"},"observation_digest":"sha256:e0d38e6460a7295a4e875b7e4d217a01194b94cb855cdd1455d05d2761f12cbe","observation_id":"4ff5f3a8-6e18-4471-966e-a5f7ff2fc138","resolution":{"observed_at":"2026-08-11T13:38:48.427892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.16410","last_updated":"2023-06-28T17:57:10Z","snapshot_observed_at":"2026-08-12T11:22:04.135857Z","submitted_at":"2023-06-28T17:57:10Z","title":"Towards Language Models That Can See: Computer Vision Through the LENS of Natural Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.16410","snapshot_observed_at":"2026-08-11T13:38:48.431347Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12940","last_updated":"2024-12-17T14:18:50Z","snapshot_observed_at":"2026-08-11T13:32:16.151433Z","submitted_at":"2024-12-17T14:18:50Z","title":"Improving Fine-grained Visual Understanding in VLMs through Text-Only Training","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:48.431347Z"},"links":{"cited_paper":"/paper/2306.16410","citing_paper":"/paper/2412.12940"},"observation_digest":"sha256:b8e06f46047eb49db593cf99d89c44aa90ab03c98199666094b5fa41ed8be8f9","observation_id":"9f3ee29b-54d9-4056-b79e-1a3b50a14088","resolution":{"observed_at":"2026-08-11T13:38:48.431347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:49.120517Z","title":null,"venue":null,"work_id":"2572ec99-894e-4e12-ac0c-3773ff2d800d","year":1999},"citing_paper":{"arxiv_id":"2412.12940","last_updated":"2024-12-17T14:18:50Z","snapshot_observed_at":"2026-08-11T13:32:16.151433Z","submitted_at":"2024-12-17T14:18:50Z","title":"Improving Fine-grained Visual Understanding in VLMs through Text-Only Training","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:48.435663Z"},"links":{"citing_paper":"/paper/2412.12940"},"observation_digest":"sha256:a1d2b2f96708e2a14bb797aca8aa4125379e0605c5c6940ef25d4a1c0a161bcf","observation_id":"c50e91d1-5df6-41cf-9dde-fe077f4d97f3","resolution":{"observed_at":"2026-08-11T13:38:49.123955Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23676","last_updated":"2024-10-31T06:55:24Z","snapshot_observed_at":"2026-08-11T22:06:25.098464Z","submitted_at":"2024-10-31T06:55:24Z","title":"Web-Scale Visual Entity Recognition: An LLM-Driven Data Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23676","snapshot_observed_at":"2026-08-11T13:38:48.439701Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12940","last_updated":"2024-12-17T14:18:50Z","snapshot_observed_at":"2026-08-11T13:32:16.151433Z","submitted_at":"2024-12-17T14:18:50Z","title":"Improving Fine-grained Visual Understanding in VLMs through Text-Only Training","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:48.439701Z"},"links":{"cited_paper":"/paper/2410.23676","citing_paper":"/paper/2412.12940"},"observation_digest":"sha256:1ae107b3919566ae9f17c38d54ad6c5c940d006dbba0c06b820d1fa4154d52e6","observation_id":"d2524bb3-5842-4a0c-8db3-b5e20ff37f14","resolution":{"observed_at":"2026-08-11T13:38:48.439701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:48.443399Z","title":"E.; et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12940","last_updated":"2024-12-17T14:18:50Z","snapshot_observed_at":"2026-08-11T13:32:16.151433Z","submitted_at":"2024-12-17T14:18:50Z","title":"Improving Fine-grained Visual Understanding in VLMs through Text-Only Training","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:48.443399Z"},"links":{"citing_paper":"/paper/2412.12940"},"observation_digest":"sha256:b7c657125ae7035c41a4b9f6362fb556ad33b0eb04fd4a6db30372addfd77c82","observation_id":"c1afdd27-89e9-4517-965a-1939588c699a","resolution":{"observed_at":"2026-08-11T13:38:48.443399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-11T13:38:48.460520Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12940","last_updated":"2024-12-17T14:18:50Z","snapshot_observed_at":"2026-08-11T13:32:16.151433Z","submitted_at":"2024-12-17T14:18:50Z","title":"Improving Fine-grained Visual Understanding in VLMs through Text-Only Training","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:48.460520Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2412.12940"},"observation_digest":"sha256:0a89cda3d8692ee3af646a3de4ca1185b72b28d189a5a4de274e8f688c8d6304","observation_id":"50fe8086-f1be-40f8-9841-b3716de52634","resolution":{"observed_at":"2026-08-11T13:38:48.460520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-08T22:04:13.117781Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-11T13:38:48.505212Z","title":"S.; Lynch, C.; Chowdhery, A.; Ichter, B.; Wahid, A.; Tompson, J.; Vuong, Q.; Yu, T.; et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12940","last_updated":"2024-12-17T14:18:50Z","snapshot_observed_at":"2026-08-11T13:32:16.151433Z","submitted_at":"2024-12-17T14:18:50Z","title":"Improving Fine-grained Visual Understanding in VLMs through Text-Only Training","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:48.505212Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2412.12940"},"observation_digest":"sha256:77af982ce6409720396fa0fda7041a9a7600455fdc88d21a5be73c416b01f7a6","observation_id":"32c308d1-7ce9-425d-b961-4344e7ebf56a","resolution":{"observed_at":"2026-08-11T13:38:48.505212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:49.103865Z","title":null,"venue":null,"work_id":"a05a2d0d-2a06-4468-a886-608fa2e32c69","year":2010},"citing_paper":{"arxiv_id":"2412.12940","last_updated":"2024-12-17T14:18:50Z","snapshot_observed_at":"2026-08-11T13:32:16.151433Z","submitted_at":"2024-12-17T14:18:50Z","title":"Improving Fine-grained Visual Understanding in VLMs through Text-Only Training","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:48.546688Z"},"links":{"citing_paper":"/paper/2412.12940"},"observation_digest":"sha256:deb1e9b8c69771e2367582575d8ef5e7ee1b400ec74c7ad881ff2215c869779b","observation_id":"77d4a999-ef3f-4ef2-92e7-bbbead272f72","resolution":{"observed_at":"2026-08-11T13:38:49.107337Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-11T13:38:48.572034Z","title":"P.; Perelman, A.; Ramesh, A.; Clark, A.; Ostrow, A.; Welihinda, A.; Hayes, A.; Radford, A.; et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12940","last_updated":"2024-12-17T14:18:50Z","snapshot_observed_at":"2026-08-11T13:32:16.151433Z","submitted_at":"2024-12-17T14:18:50Z","title":"Improving Fine-grained Visual Understanding in VLMs through Text-Only Training","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:48.572034Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2412.12940"},"observation_digest":"sha256:f61dbafacf6e812c03a10931f94911bf083d371b8528ac2a09e93915d3f71585","observation_id":"76ed9def-f302-4623-91f1-2ae4399f6f76","resolution":{"observed_at":"2026-08-11T13:38:48.572034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-11T13:38:48.640228Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12940","last_updated":"2024-12-17T14:18:50Z","snapshot_observed_at":"2026-08-11T13:32:16.151433Z","submitted_at":"2024-12-17T14:18:50Z","title":"Improving Fine-grained Visual Understanding in VLMs through Text-Only Training","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:48.640228Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2412.12940"},"observation_digest":"sha256:b77b897d298b0fe653b50c2b75e08fd203d3311ac0090d9bc5ddc75dd6c1df2a","observation_id":"49e3ff2c-b675-425c-9aeb-2650e2bad0d0","resolution":{"observed_at":"2026-08-11T13:38:48.640228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:48.674294Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12940","last_updated":"2024-12-17T14:18:50Z","snapshot_observed_at":"2026-08-11T13:32:16.151433Z","submitted_at":"2024-12-17T14:18:50Z","title":"Improving Fine-grained Visual Understanding in VLMs through Text-Only Training","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:48.674294Z"},"links":{"citing_paper":"/paper/2412.12940"},"observation_digest":"sha256:132d3b58e052a13832934c95108efa7d85776be2ab06c1c5b31cfccf3ddb5dd0","observation_id":"f8183eb8-cd66-4691-96e3-ed86ff1e76a5","resolution":{"observed_at":"2026-08-11T13:38:48.674294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:48.677915Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12940","last_updated":"2024-12-17T14:18:50Z","snapshot_observed_at":"2026-08-11T13:32:16.151433Z","submitted_at":"2024-12-17T14:18:50Z","title":"Improving Fine-grained Visual Understanding in VLMs through Text-Only Training","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:48.677915Z"},"links":{"citing_paper":"/paper/2412.12940"},"observation_digest":"sha256:c3025731fd378c11003ffe0e29bd384323f844d6bd3d18bed46c57f2f6b384a4","observation_id":"28f271c5-3221-49f4-be25-7b2ad3227dd8","resolution":{"observed_at":"2026-08-11T13:38:48.677915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:49.080025Z","title":null,"venue":null,"work_id":"3058eb24-99b8-4708-9d9b-5e427df5bdc5","year":2023},"citing_paper":{"arxiv_id":"2412.12940","last_updated":"2024-12-17T14:18:50Z","snapshot_observed_at":"2026-08-11T13:32:16.151433Z","submitted_at":"2024-12-17T14:18:50Z","title":"Improving Fine-grained Visual Understanding in VLMs through Text-Only Training","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:48.681281Z"},"links":{"citing_paper":"/paper/2412.12940"},"observation_digest":"sha256:539a25119b2e05d89ae24bb58fc32001fcf672c57c6908410917ff7b9d52e2d9","observation_id":"a5fa7fda-a0b8-4da7-8e7c-458c2bb54727","resolution":{"observed_at":"2026-08-11T13:38:49.083532Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:49.067106Z","title":null,"venue":null,"work_id":"7b43af20-8d7c-489f-8e19-97fb33037337","year":2023},"citing_paper":{"arxiv_id":"2412.12940","last_updated":"2024-12-17T14:18:50Z","snapshot_observed_at":"2026-08-11T13:32:16.151433Z","submitted_at":"2024-12-17T14:18:50Z","title":"Improving Fine-grained Visual Understanding in VLMs through Text-Only Training","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:48.684405Z"},"links":{"citing_paper":"/paper/2412.12940"},"observation_digest":"sha256:fc513291c4fa4715789b416525a1d6f7dea28913f5a94e2b6fd3bf40a740ae15","observation_id":"8ccddd14-43e4-45fb-aa4c-81fa8f4657ae","resolution":{"observed_at":"2026-08-11T13:38:49.072948Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10350","last_updated":"2021-04-23T14:26:29Z","snapshot_observed_at":"2026-07-06T11:02:18.405330Z","submitted_at":"2021-04-21T04:44:25Z","title":"Carbon Emissions and Large Neural Network Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.10350","snapshot_observed_at":"2026-08-11T13:38:48.688127Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.12940","last_updated":"2024-12-17T14:18:50Z","snapshot_observed_at":"2026-08-11T13:32:16.151433Z","submitted_at":"2024-12-17T14:18:50Z","title":"Improving Fine-grained Visual Understanding in VLMs through Text-Only Training","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:48.688127Z"},"links":{"cited_paper":"/paper/2104.10350","citing_paper":"/paper/2412.12940"},"observation_digest":"sha256:e2c1da695a895671c7fe2da67d906ac984244f06f9e5391c6799c6783bd39903","observation_id":"1acb917f-de01-4d4b-91b3-42fc795eb1af","resolution":{"observed_at":"2026-08-11T13:38:48.688127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:48.692182Z","title":"W.; Hallacy, C.; Ramesh, A.; Goh, G.; Agarwal, S.; Sastry, G.; Askell, A.; Mishkin, P.; Clark, J.; et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.12940","last_updated":"2024-12-17T14:18:50Z","snapshot_observed_at":"2026-08-11T13:32:16.151433Z","submitted_at":"2024-12-17T14:18:50Z","title":"Improving Fine-grained Visual Understanding in VLMs through Text-Only Training","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:48.692182Z"},"links":{"citing_paper":"/paper/2412.12940"},"observation_digest":"sha256:62b6c7718f3b7a22050a89761d6404364d71763baebfb950cb74c7c2e75271e0","observation_id":"407c2d59-c536-4c40-a3ee-03e257cc2d8f","resolution":{"observed_at":"2026-08-11T13:38:48.692182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.08402","last_updated":"2022-10-16T00:08:18Z","snapshot_observed_at":"2026-07-29T21:51:47.064287Z","submitted_at":"2022-10-16T00:08:18Z","title":"LAION-5B: An open large-scale dataset for training next generation image-text models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.08402","snapshot_observed_at":"2026-08-11T13:38:48.695364Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.12940","last_updated":"2024-12-17T14:18:50Z","snapshot_observed_at":"2026-08-11T13:32:16.151433Z","submitted_at":"2024-12-17T14:18:50Z","title":"Improving Fine-grained Visual Understanding in VLMs through Text-Only Training","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:48.695364Z"},"links":{"cited_paper":"/paper/2210.08402","citing_paper":"/paper/2412.12940"},"observation_digest":"sha256:cfe9e8c41d8e40aedda01fecd1e808222d94e9b169e1a6e1fbeb667c26eba01b","observation_id":"37f9900e-44ce-4094-870f-d90016f9b138","resolution":{"observed_at":"2026-08-11T13:38:48.695364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-11T13:38:48.699233Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12940","last_updated":"2024-12-17T14:18:50Z","snapshot_observed_at":"2026-08-11T13:32:16.151433Z","submitted_at":"2024-12-17T14:18:50Z","title":"Improving Fine-grained Visual Understanding in VLMs through Text-Only Training","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:48.699233Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2412.12940"},"observation_digest":"sha256:dfac7852cf739ae67b9d4ce19d1de190193255d1d4d565f1e683473f8ef9c5be","observation_id":"c3a75ae1-5564-49f1-af93-d6791e11b48b","resolution":{"observed_at":"2026-08-11T13:38:48.699233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:49.046360Z","title":null,"venue":null,"work_id":"2152ee09-f81c-4f4b-a3a7-a44b07fe8ce4","year":2007},"citing_paper":{"arxiv_id":"2412.12940","last_updated":"2024-12-17T14:18:50Z","snapshot_observed_at":"2026-08-11T13:32:16.151433Z","submitted_at":"2024-12-17T14:18:50Z","title":"Improving Fine-grained Visual Understanding in VLMs through Text-Only Training","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:48.703428Z"},"links":{"citing_paper":"/paper/2412.12940"},"observation_digest":"sha256:dacbe59df294ab3a1b6ebfaf960f319d3edabaa35973e76e662af7f7e22a51c6","observation_id":"a7ceefd9-4a8a-44e0-857e-af25f44d6e12","resolution":{"observed_at":"2026-08-11T13:38:49.054240Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:48.706644Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12940","last_updated":"2024-12-17T14:18:50Z","snapshot_observed_at":"2026-08-11T13:32:16.151433Z","submitted_at":"2024-12-17T14:18:50Z","title":"Improving Fine-grained Visual Understanding in VLMs through Text-Only Training","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:48.706644Z"},"links":{"citing_paper":"/paper/2412.12940"},"observation_digest":"sha256:dbf64a73de576dda086026752781853ebcf2e479a51d41196542fde2b17e52b3","observation_id":"e78a243b-1b4a-4bfd-ad87-5843e7feadc0","resolution":{"observed_at":"2026-08-11T13:38:48.706644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:48.878117Z","title":null,"venue":null,"work_id":"4ac950fd-e2eb-487b-9db0-77cdc75f11f1","year":2024},"citing_paper":{"arxiv_id":"2412.12940","last_updated":"2024-12-17T14:18:50Z","snapshot_observed_at":"2026-08-11T13:32:16.151433Z","submitted_at":"2024-12-17T14:18:50Z","title":"Improving Fine-grained Visual Understanding in VLMs through Text-Only Training","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:48.710069Z"},"links":{"citing_paper":"/paper/2412.12940"},"observation_digest":"sha256:d2a7d2e5217c1f2aa018706921d0093f291d768342fe26ac3f076e843b36f4ed","observation_id":"1aa65b62-02f3-48c3-8fb4-67c2de24ef24","resolution":{"observed_at":"2026-08-11T13:38:48.941388Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:48.714006Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12940","last_updated":"2024-12-17T14:18:50Z","snapshot_observed_at":"2026-08-11T13:32:16.151433Z","submitted_at":"2024-12-17T14:18:50Z","title":"Improving Fine-grained Visual Understanding in VLMs through Text-Only Training","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:48.714006Z"},"links":{"citing_paper":"/paper/2412.12940"},"observation_digest":"sha256:64ee78c6ec4cd66429c47a315e5768a316c69302ddfd55a4b03e865693b128ee","observation_id":"fe62e698-93f6-4ecc-91e9-179aa452b368","resolution":{"observed_at":"2026-08-11T13:38:48.714006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:38:48.718208Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12940","last_updated":"2024-12-17T14:18:50Z","snapshot_observed_at":"2026-08-11T13:32:16.151433Z","submitted_at":"2024-12-17T14:18:50Z","title":"Improving Fine-grained Visual Understanding in VLMs through Text-Only Training","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T13:38:48.718208Z"},"links":{"citing_paper":"/paper/2412.12940"},"observation_digest":"sha256:0444e75199abf604ab855d9b795f89cd0d3b5412b06a1f0f84fa8f13fe79fb42","observation_id":"4eb4a3ed-ce2c-4ac9-963b-a573c338a0ca","resolution":{"observed_at":"2026-08-11T13:38:48.718208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.12940","last_updated":"2024-12-17T14:18:50Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-11T13:32:16.151433Z","submitted_at":"2024-12-17T14:18:50Z","title":"Improving Fine-grained Visual Understanding in VLMs through Text-Only Training"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 3 inbound Pith citation observations for arXiv:2412.12940."}