{"as_of":"2026-08-18T06:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b24e88a100ea454f3e5c756ebdd3cd3fdc3cba18ca8cf11b77660b550fdc09a4","coverage":[{"denominator":16,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T14:56:25.274118Z","state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:13:55.100419Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-16T10:13:25.893446Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.11475","last_updated":"2026-07-20T02:07:28Z","snapshot_observed_at":"2026-08-18T03:02:30.383382Z","submitted_at":"2024-12-16T06:38:00Z","title":"OmniVLM: A Token-Compressed, Sub-Billion-Parameter Vision-Language Model for Efficient On-Device Inference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.11475","snapshot_observed_at":"2026-08-16T12:13:55.100419Z","title":"Omnivlm: A token-compressed, sub-billion- parameter vision-language model for efficient on-device inference,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13399","last_updated":"2025-04-18T01:25:02Z","snapshot_observed_at":"2026-08-17T21:28:19.169684Z","submitted_at":"2025-04-18T01:25:02Z","title":"Towards a Multi-Agent Vision-Language System for Zero-Shot Novel Hazardous Object Detection for Autonomous Driving Safety","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T12:13:55.100419Z"},"links":{"cited_paper":"/paper/2412.11475","citing_paper":"/paper/2504.13399"},"observation_digest":"sha256:30debea1a970c20610619bed688f63dbdfec2ed2ee624e7754f3be903c258b11","observation_id":"55649044-730d-41c5-bbe2-e7f7f061fbba","resolution":{"observed_at":"2026-08-16T12:13:55.100419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11475","last_updated":"2026-07-20T02:07:28Z","snapshot_observed_at":"2026-08-18T03:02:30.383382Z","submitted_at":"2024-12-16T06:38:00Z","title":"OmniVLM: A Token-Compressed, Sub-Billion-Parameter Vision-Language Model for Efficient On-Device Inference","version":3},"cited_work":{"arxiv_id":"2412.11475","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.11475","snapshot_observed_at":"2026-08-16T10:13:25.893446Z","title":"OmniVLM: A Token-Compressed, Sub-Billion-Parameter Vision-Language Model for Efficient On-Device Inference","venue":"cs.CV","work_id":"987c82f0-9d55-43aa-92e9-d0ca380c6140","year":2024},"citing_paper":{"arxiv_id":"2504.18738","last_updated":"2025-04-25T23:27:26Z","snapshot_observed_at":"2026-08-16T10:08:15.848040Z","submitted_at":"2025-04-25T23:27:26Z","title":"A Review of 3D Object Detection with Vision-Language Models","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:25.113330Z"},"links":{"cited_paper":"/paper/2412.11475","citing_paper":"/paper/2504.18738"},"observation_digest":"sha256:acefebdff94564be04ca470c2598d417d5273e574ef5a495172293fe49e3710f","observation_id":"8febbffd-7988-46e7-b6ce-d4a41c792e9f","resolution":{"observed_at":"2026-08-16T10:13:26.010057Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11475","last_updated":"2026-07-20T02:07:28Z","snapshot_observed_at":"2026-08-18T03:02:30.383382Z","submitted_at":"2024-12-16T06:38:00Z","title":"OmniVLM: A Token-Compressed, Sub-Billion-Parameter Vision-Language Model for Efficient On-Device Inference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.11475","snapshot_observed_at":"2026-08-03T18:56:56.607192Z","title":"Omnivlm: A token-compressed, sub-billion-parameter vision- language model for efficient on-device inference, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.02924","last_updated":"2026-07-20T02:01:50Z","snapshot_observed_at":"2026-08-16T23:56:58.630469Z","submitted_at":"2025-12-02T16:45:25Z","title":"AutoNeural: Co-Designing Vision-Language Models for NPU Inference","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T18:56:56.607192Z"},"links":{"cited_paper":"/paper/2412.11475","citing_paper":"/paper/2512.02924"},"observation_digest":"sha256:bc3bf7bafce621e18d1e70502f9e734ab5ddbd893ae22221ba5549221b705705","observation_id":"77ac84e2-5936-4016-a7af-df25475e5e91","resolution":{"observed_at":"2026-08-03T18:56:56.607192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.11475/citation-record","integrity":"/paper/2412.11475/integrity","json":"/paper/2412.11475/citation-record.json","paper":"/paper/2412.11475"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-11T14:56:25.183742Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11475","last_updated":"2026-07-20T02:07:28Z","snapshot_observed_at":"2026-08-18T03:02:30.383382Z","submitted_at":"2024-12-16T06:38:00Z","title":"OmniVLM: A Token-Compressed, Sub-Billion-Parameter Vision-Language Model for Efficient On-Device Inference","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T14:56:25.183742Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2412.11475"},"observation_digest":"sha256:28d50e818f83a354e4ce66f1c1631ec1039282cc37e429d44ea472bc500b1c80","observation_id":"ec0e5239-7dd6-4732-b339-de7ac23051de","resolution":{"observed_at":"2026-08-11T14:56:25.183742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15518","last_updated":"2026-07-20T02:08:41Z","snapshot_observed_at":"2026-08-16T13:23:19.632319Z","submitted_at":"2024-08-28T04:06:14Z","title":"Squid: Long Context as a New Modality for Energy-Efficient On-Device Language Models","version":3},"cited_work":{"arxiv_id":"2408.15518","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.15518","snapshot_observed_at":"2026-08-11T14:56:25.472353Z","title":"Squid: Long Context as a New Modality for Energy-Efficient On-Device Language Models","venue":"cs.CL","work_id":"9d979596-8ef3-44a1-80ed-7d5f04efe3cb","year":2024},"citing_paper":{"arxiv_id":"2412.11475","last_updated":"2026-07-20T02:07:28Z","snapshot_observed_at":"2026-08-18T03:02:30.383382Z","submitted_at":"2024-12-16T06:38:00Z","title":"OmniVLM: A Token-Compressed, Sub-Billion-Parameter Vision-Language Model for Efficient On-Device Inference","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T14:56:25.202850Z"},"links":{"cited_paper":"/paper/2408.15518","citing_paper":"/paper/2412.11475"},"observation_digest":"sha256:a572dcca594b6aaa8af72e9af8b9fd5df01c951e90667a382bc072c66a4070fa","observation_id":"1f0d4402-6331-47f9-94f2-7efc9df631d6","resolution":{"observed_at":"2026-08-11T14:56:25.479973Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08177","last_updated":"2024-02-23T02:22:36Z","snapshot_observed_at":"2026-08-16T18:14:14.086565Z","submitted_at":"2023-04-17T11:39:53Z","title":"Efficient and Effective Text Encoding for Chinese LLaMA and Alpaca","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08177","snapshot_observed_at":"2026-08-11T14:56:25.208369Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11475","last_updated":"2026-07-20T02:07:28Z","snapshot_observed_at":"2026-08-18T03:02:30.383382Z","submitted_at":"2024-12-16T06:38:00Z","title":"OmniVLM: A Token-Compressed, Sub-Billion-Parameter Vision-Language Model for Efficient On-Device Inference","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T14:56:25.208369Z"},"links":{"cited_paper":"/paper/2304.08177","citing_paper":"/paper/2412.11475"},"observation_digest":"sha256:f78127e6007f16467808221b939d0cb606a6f3bebad21e49291f4a28f641087e","observation_id":"6fbdb3aa-9b2e-474b-9c87-03e0955f30d8","resolution":{"observed_at":"2026-08-11T14:56:25.208369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-11T14:56:25.214844Z","title":"Dosovitskiy","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.11475","last_updated":"2026-07-20T02:07:28Z","snapshot_observed_at":"2026-08-18T03:02:30.383382Z","submitted_at":"2024-12-16T06:38:00Z","title":"OmniVLM: A Token-Compressed, Sub-Billion-Parameter Vision-Language Model for Efficient On-Device Inference","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T14:56:25.214844Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2412.11475"},"observation_digest":"sha256:beaa70d8b9798c1e6dbb9fab1b52b93ea8c5c305c94fb0a3facf01cca9f19ce9","observation_id":"63199eca-cfec-4be8-bdce-b47ddd994430","resolution":{"observed_at":"2026-08-11T14:56:25.214844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18967","last_updated":"2025-02-28T00:29:14Z","snapshot_observed_at":"2026-08-16T13:06:10.824268Z","submitted_at":"2024-10-24T17:58:31Z","title":"Ferret-UI 2: Mastering Universal User Interface Understanding Across Platforms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18967","snapshot_observed_at":"2026-08-11T14:56:25.225612Z","title":"Gerganov","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11475","last_updated":"2026-07-20T02:07:28Z","snapshot_observed_at":"2026-08-18T03:02:30.383382Z","submitted_at":"2024-12-16T06:38:00Z","title":"OmniVLM: A Token-Compressed, Sub-Billion-Parameter Vision-Language Model for Efficient On-Device Inference","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T14:56:25.225612Z"},"links":{"cited_paper":"/paper/2410.18967","citing_paper":"/paper/2412.11475"},"observation_digest":"sha256:a17769493018b4b8329be23ef2cde9ff78b3f04bd0e053e2260516178e5cd9ff","observation_id":"496b8a2e-bd61-47f1-b964-64b98ae0a7ad","resolution":{"observed_at":"2026-08-11T14:56:25.225612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14905","last_updated":"2024-06-27T03:53:46Z","snapshot_observed_at":"2026-08-16T14:16:07.202427Z","submitted_at":"2024-02-22T18:58:55Z","title":"MobileLLM: Optimizing Sub-billion Parameter Language Models for On-Device Use Cases","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14905","snapshot_observed_at":"2026-08-11T14:56:25.236951Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11475","last_updated":"2026-07-20T02:07:28Z","snapshot_observed_at":"2026-08-18T03:02:30.383382Z","submitted_at":"2024-12-16T06:38:00Z","title":"OmniVLM: A Token-Compressed, Sub-Billion-Parameter Vision-Language Model for Efficient On-Device Inference","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T14:56:25.236951Z"},"links":{"cited_paper":"/paper/2402.14905","citing_paper":"/paper/2412.11475"},"observation_digest":"sha256:5f12cb0fc859992f857579a99fefb8de790f7d1136b7e53e750131d885de721c","observation_id":"f2352a00-6adc-4510-ae19-c616f3862b2f","resolution":{"observed_at":"2026-08-11T14:56:25.236951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:56:25.584850Z","title":"Introducing orion, our first true augmented reality glasses, 2024b","venue":null,"work_id":"4899eade-15bd-4aed-a6d8-885c44a62cb2","year":2024},"citing_paper":{"arxiv_id":"2412.11475","last_updated":"2026-07-20T02:07:28Z","snapshot_observed_at":"2026-08-18T03:02:30.383382Z","submitted_at":"2024-12-16T06:38:00Z","title":"OmniVLM: A Token-Compressed, Sub-Billion-Parameter Vision-Language Model for Efficient On-Device Inference","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T14:56:25.247829Z"},"links":{"citing_paper":"/paper/2412.11475"},"observation_digest":"sha256:cb43b0201f30d118da331d8e2a5f4a3822d22a748dccb2617d928673ff1a66eb","observation_id":"4a1886ed-1fba-44c1-b721-05aada00d860","resolution":{"observed_at":"2026-08-11T14:56:25.589922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:56:25.566142Z","title":"MLC-LLM, 2023-2024","venue":null,"work_id":"f45492b3-4f8f-47a9-b838-e5d3883ce923","year":2023},"citing_paper":{"arxiv_id":"2412.11475","last_updated":"2026-07-20T02:07:28Z","snapshot_observed_at":"2026-08-18T03:02:30.383382Z","submitted_at":"2024-12-16T06:38:00Z","title":"OmniVLM: A Token-Compressed, Sub-Billion-Parameter Vision-Language Model for Efficient On-Device Inference","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T14:56:25.253485Z"},"links":{"citing_paper":"/paper/2412.11475"},"observation_digest":"sha256:87e047fa661bdbf915412d4961b885bffbda5681cfa62de9108fd70d747e2481","observation_id":"ebb69450-b345-4078-a341-33f7d557fb7a","resolution":{"observed_at":"2026-08-11T14:56:25.573347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:56:25.548299Z","title":"Ollama, 2023-2024","venue":null,"work_id":"48cda6ea-3704-453c-93df-aa4ce0edf783","year":2023},"citing_paper":{"arxiv_id":"2412.11475","last_updated":"2026-07-20T02:07:28Z","snapshot_observed_at":"2026-08-18T03:02:30.383382Z","submitted_at":"2024-12-16T06:38:00Z","title":"OmniVLM: A Token-Compressed, Sub-Billion-Parameter Vision-Language Model for Efficient On-Device Inference","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T14:56:25.258419Z"},"links":{"citing_paper":"/paper/2412.11475"},"observation_digest":"sha256:e09151695b4e6464c738bfad671c35665afc98484a3e503a8b9300b5cd51a71a","observation_id":"3d6cf64b-e886-48b7-b655-d3e64e53dee7","resolution":{"observed_at":"2026-08-11T14:56:25.553554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-11T14:56:25.264091Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11475","last_updated":"2026-07-20T02:07:28Z","snapshot_observed_at":"2026-08-18T03:02:30.383382Z","submitted_at":"2024-12-16T06:38:00Z","title":"OmniVLM: A Token-Compressed, Sub-Billion-Parameter Vision-Language Model for Efficient On-Device Inference","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T14:56:25.264091Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2412.11475"},"observation_digest":"sha256:f281887f2706784dc34f68b4563df4307f44df35d540a1aac44afb2e8edf8745","observation_id":"4b3f9571-f3a6-4321-87be-95806625a7a4","resolution":{"observed_at":"2026-08-11T14:56:25.264091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-11T14:56:25.269637Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11475","last_updated":"2026-07-20T02:07:28Z","snapshot_observed_at":"2026-08-18T03:02:30.383382Z","submitted_at":"2024-12-16T06:38:00Z","title":"OmniVLM: A Token-Compressed, Sub-Billion-Parameter Vision-Language Model for Efficient On-Device Inference","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T14:56:25.269637Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2412.11475"},"observation_digest":"sha256:c70fff138182d7b3d2311aa129d3abd01dbfaa189fdfc6c66b81d0f0ed8b658e","observation_id":"0069e66d-5914-41fd-9b25-78e40bd0ce71","resolution":{"observed_at":"2026-08-11T14:56:25.269637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15343","last_updated":"2023-09-27T12:05:41Z","snapshot_observed_at":"2026-07-06T15:08:30.190912Z","submitted_at":"2023-03-27T15:53:01Z","title":"Sigmoid Loss for Language Image Pre-Training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15343","snapshot_observed_at":"2026-08-11T14:56:25.274118Z","title":"10 OmniVLM: A Token-Compressed, Sub-Billion-Parameter Vision-Language Model for Efficient On-Device Inference C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11475","last_updated":"2026-07-20T02:07:28Z","snapshot_observed_at":"2026-08-18T03:02:30.383382Z","submitted_at":"2024-12-16T06:38:00Z","title":"OmniVLM: A Token-Compressed, Sub-Billion-Parameter Vision-Language Model for Efficient On-Device Inference","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T14:56:25.274118Z"},"links":{"cited_paper":"/paper/2303.15343","citing_paper":"/paper/2412.11475"},"observation_digest":"sha256:1114786fa473f4a97b8cfdb9e4a6a74199510cd8dd644cbe635f8d97227b330e","observation_id":"ab87ea45-a88f-423b-b55c-b993cb534dd1","resolution":{"observed_at":"2026-08-11T14:56:25.274118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-11T14:56:25.220199Z","title":"Dubey, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11475","last_updated":"2026-07-20T02:07:28Z","snapshot_observed_at":"2026-08-18T03:02:30.383382Z","submitted_at":"2024-12-16T06:38:00Z","title":"OmniVLM: A Token-Compressed, Sub-Billion-Parameter Vision-Language Model for Efficient On-Device Inference","version":3},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-11T14:56:25.220199Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2412.11475"},"observation_digest":"sha256:31fb73d356a0d993ebc031c3f6005c2b3a9bc2e56f0b0e2823b477e3baaf9ef6","observation_id":"d8a55622-171e-420c-9ed2-34191e0a8516","resolution":{"observed_at":"2026-08-11T14:56:25.220199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:56:25.601809Z","title":null,"venue":null,"work_id":"1a09b4c8-212a-416e-8040-b1206e177b24","year":2023},"citing_paper":{"arxiv_id":"2412.11475","last_updated":"2026-07-20T02:07:28Z","snapshot_observed_at":"2026-08-18T03:02:30.383382Z","submitted_at":"2024-12-16T06:38:00Z","title":"OmniVLM: A Token-Compressed, Sub-Billion-Parameter Vision-Language Model for Efficient On-Device Inference","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-11T14:56:25.242212Z"},"links":{"citing_paper":"/paper/2412.11475"},"observation_digest":"sha256:ff764ccf9e06ddc5d60cea9eed15cd3c8429903bb76778e9a22335e13e5b861c","observation_id":"0c22894f-f28d-41a2-8d7c-f5986ea75aac","resolution":{"observed_at":"2026-08-11T14:56:25.607247Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-11T14:56:25.190474Z","title":"Beyer, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11475","last_updated":"2026-07-20T02:07:28Z","snapshot_observed_at":"2026-08-18T03:02:30.383382Z","submitted_at":"2024-12-16T06:38:00Z","title":"OmniVLM: A Token-Compressed, Sub-Billion-Parameter Vision-Language Model for Efficient On-Device Inference","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T14:56:25.190474Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2412.11475"},"observation_digest":"sha256:3ae00ed10ee154a1e03089fafdbfe959e4f5d58cff9ecc8eaf287da7936488bf","observation_id":"c259c23c-8566-4ad1-bea6-68f281cee6dd","resolution":{"observed_at":"2026-08-11T14:56:25.190474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01744","last_updated":"2026-07-20T02:23:52Z","snapshot_observed_at":"2026-08-16T14:04:23.933244Z","submitted_at":"2024-04-02T09:01:32Z","title":"Octopus v2: On-device language model for super agent","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01744","snapshot_observed_at":"2026-08-11T14:56:25.197362Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11475","last_updated":"2026-07-20T02:07:28Z","snapshot_observed_at":"2026-08-18T03:02:30.383382Z","submitted_at":"2024-12-16T06:38:00Z","title":"OmniVLM: A Token-Compressed, Sub-Billion-Parameter Vision-Language Model for Efficient On-Device Inference","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T14:56:25.197362Z"},"links":{"cited_paper":"/paper/2404.01744","citing_paper":"/paper/2412.11475"},"observation_digest":"sha256:f29b78bae3b77662d106f50a8adfc635016fe90a38c214a6dbd87a66befc2cba","observation_id":"d4fd3c01-5ede-4f6a-9ed0-b8e86d0f0e5b","resolution":{"observed_at":"2026-08-11T14:56:25.197362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.11475","last_updated":"2026-07-20T02:07:28Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T03:02:30.383382Z","submitted_at":"2024-12-16T06:38:00Z","title":"OmniVLM: A Token-Compressed, Sub-Billion-Parameter Vision-Language Model for Efficient On-Device Inference"},"reference_resolution":{"displayed":16,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":1,"verified_fuzzy":3},"total_outbound_references":16},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 16 of 16 outbound references and 3 inbound Pith citation observations for arXiv:2412.11475."}