{"as_of":"2026-08-16T05:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2f7213f8493d1bb104c2504cdea576b79880570f68e66e0d20d60e27ca76cd76","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":8,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":8,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T18:05:09.305960Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-16T23:01:20.549286Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2409.14818","last_updated":"2024-10-03T05:23:22Z","snapshot_observed_at":"2026-08-12T22:39:47.163392Z","submitted_at":"2024-09-23T08:47:54Z","title":"MobileVLM: A Vision-Language Model for Better Intra- and Inter-UI Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14818","snapshot_observed_at":"2026-08-12T18:32:12.123346Z","title":"Mobilevlm: A vision-language model for better intra-and inter-ui under- standing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11496","last_updated":"2024-11-28T02:07:46Z","snapshot_observed_at":"2026-08-14T06:21:41.085599Z","submitted_at":"2024-11-18T11:58:07Z","title":"Safe + Safe = Unsafe? Exploring How Safe Images Can Be Exploited to Jailbreak Large Vision-Language Models","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T18:32:12.123346Z"},"links":{"cited_paper":"/paper/2409.14818","citing_paper":"/paper/2411.11496"},"observation_digest":"sha256:da6da7aee02b8570e099fd565bcac46a85e7fd455b3264a468ad8da80f4206ad","observation_id":"ac52c24c-3ca5-416f-8f7b-1a5271ba8a31","resolution":{"observed_at":"2026-08-12T18:32:12.123346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14818","last_updated":"2024-10-03T05:23:22Z","snapshot_observed_at":"2026-08-12T22:39:47.163392Z","submitted_at":"2024-09-23T08:47:54Z","title":"MobileVLM: A Vision-Language Model for Better Intra- and Inter-UI Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14818","snapshot_observed_at":"2026-08-07T14:46:17.299342Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17629","last_updated":"2025-05-27T07:41:51Z","snapshot_observed_at":"2026-08-13T13:26:58.575149Z","submitted_at":"2025-05-23T08:39:06Z","title":"TransBench: Breaking Barriers for Transferable Graphical User Interface Agents in Dynamic Digital Environments","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T14:46:17.299342Z"},"links":{"cited_paper":"/paper/2409.14818","citing_paper":"/paper/2505.17629"},"observation_digest":"sha256:5846eb2bfd0259236d4bb1005886f648c90b80dd94b1190a241d36fc4006fbca","observation_id":"a3101dcc-14ae-417c-b28b-5c12cf8a2975","resolution":{"observed_at":"2026-08-07T14:46:17.299342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14818","last_updated":"2024-10-03T05:23:22Z","snapshot_observed_at":"2026-08-12T22:39:47.163392Z","submitted_at":"2024-09-23T08:47:54Z","title":"MobileVLM: A Vision-Language Model for Better Intra- and Inter-UI Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14818","snapshot_observed_at":"2026-08-06T23:12:56.998779Z","title":"Mobilevlm: A vision-language model for better intra-and inter-ui understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19288","last_updated":"2025-07-01T01:07:35Z","snapshot_observed_at":"2026-08-12T21:13:42.671570Z","submitted_at":"2025-06-24T03:48:48Z","title":"Da Yu: Towards USV-Based Image Captioning for Waterway Surveillance and Scene Understanding","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:56.998779Z"},"links":{"cited_paper":"/paper/2409.14818","citing_paper":"/paper/2506.19288"},"observation_digest":"sha256:04cd4fd71de9d0b9d6df8ccb4f69520e6369f55b160f57bf94e80d0ed622465d","observation_id":"ccabe1f6-81d6-4c7e-9296-bd3d434b7c5b","resolution":{"observed_at":"2026-08-06T23:12:56.998779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14818","last_updated":"2024-10-03T05:23:22Z","snapshot_observed_at":"2026-08-12T22:39:47.163392Z","submitted_at":"2024-09-23T08:47:54Z","title":"MobileVLM: A Vision-Language Model for Better Intra- and Inter-UI Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14818","snapshot_observed_at":"2026-08-15T18:05:09.305960Z","title":"Mobilevlm: A vision-language model for better intra-and inter-ui understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19132","last_updated":"2025-07-25T10:14:53Z","snapshot_observed_at":"2026-08-15T17:58:00.255391Z","submitted_at":"2025-07-25T10:14:53Z","title":"OS-MAP: How Far Can Computer-Using Agents Go in Breadth and Depth?","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T18:05:09.305960Z"},"links":{"cited_paper":"/paper/2409.14818","citing_paper":"/paper/2507.19132"},"observation_digest":"sha256:6e74ea94105a915db50c0fef5c8b2f4b5d8e54a7ab5833130dc3b9cdba0cc896","observation_id":"54489867-d679-4ce6-863a-775806b8c29f","resolution":{"observed_at":"2026-08-15T18:05:09.305960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14818","last_updated":"2024-10-03T05:23:22Z","snapshot_observed_at":"2026-08-12T22:39:47.163392Z","submitted_at":"2024-09-23T08:47:54Z","title":"MobileVLM: A Vision-Language Model for Better Intra- and Inter-UI Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14818","snapshot_observed_at":"2026-08-04T14:41:50.948851Z","title":"Mobilevlm: A vision-language model for better intra-and inter-ui understanding.arXiv preprint arXiv:2409.14818, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.24380","last_updated":"2026-07-04T03:50:21Z","snapshot_observed_at":"2026-08-14T09:02:55.806123Z","submitted_at":"2025-09-29T07:29:18Z","title":"Agentic Services Computing","version":3},"reference_index":189,"source":"pdf_text","source_observed_at":"2026-08-04T14:41:50.948851Z"},"links":{"cited_paper":"/paper/2409.14818","citing_paper":"/paper/2509.24380"},"observation_digest":"sha256:515bfed32479b1990b76d412c50059da917d181df2bb7ccbb08531ccd4304ca7","observation_id":"c663a255-1c6e-4b5c-9bae-bed7463e0359","resolution":{"observed_at":"2026-08-04T14:41:50.948851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14818","last_updated":"2024-10-03T05:23:22Z","snapshot_observed_at":"2026-08-12T22:39:47.163392Z","submitted_at":"2024-09-23T08:47:54Z","title":"MobileVLM: A Vision-Language Model for Better Intra- and Inter-UI Understanding","version":2},"cited_work":{"arxiv_id":"2409.14818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.14818","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mobilevlm: A vision-language model for better intra-and inter-ui under- standing","venue":null,"work_id":"a08e45e3-ecbc-49f1-afee-2672025cb8b7","year":2024},"citing_paper":{"arxiv_id":"2512.12634","last_updated":"2026-05-31T23:48:10Z","snapshot_observed_at":"2026-08-12T19:19:33.325681Z","submitted_at":"2025-12-14T10:41:39Z","title":"MobiBench: Multi-Branch, Modular Benchmark for Mobile GUI Agents","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-16T22:59:16.413568Z"},"links":{"cited_paper":"/paper/2409.14818","citing_paper":"/paper/2512.12634"},"observation_digest":"sha256:5635ad5e79f1fbda75bb4e2c872bfa7cd00d4e7d2ddf806babe5d566d3a216d7","observation_id":"bee5e058-a1c4-465d-b067-36467276915e","resolution":{"observed_at":"2026-05-16T23:01:20.551673Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14818","last_updated":"2024-10-03T05:23:22Z","snapshot_observed_at":"2026-08-12T22:39:47.163392Z","submitted_at":"2024-09-23T08:47:54Z","title":"MobileVLM: A Vision-Language Model for Better Intra- and Inter-UI Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14818","snapshot_observed_at":"2026-08-03T16:38:36.380317Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.12634","last_updated":"2026-05-31T23:48:10Z","snapshot_observed_at":"2026-08-12T19:19:33.325681Z","submitted_at":"2025-12-14T10:41:39Z","title":"MobiBench: Multi-Branch, Modular Benchmark for Mobile GUI Agents","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T16:38:36.380317Z"},"links":{"cited_paper":"/paper/2409.14818","citing_paper":"/paper/2512.12634"},"observation_digest":"sha256:e4657b83e5402aa93deaf0e9b625fc35657beb5944a1ec6fe9a48ed43900d9b3","observation_id":"158ccabb-312e-4251-9b5f-d3293f0093f3","resolution":{"observed_at":"2026-08-03T16:38:36.380317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14818","last_updated":"2024-10-03T05:23:22Z","snapshot_observed_at":"2026-08-12T22:39:47.163392Z","submitted_at":"2024-09-23T08:47:54Z","title":"MobileVLM: A Vision-Language Model for Better Intra- and Inter-UI Understanding","version":2},"cited_work":{"arxiv_id":"2409.14818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.14818","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mobilevlm: A vision-language model for better intra-and inter-ui under- standing","venue":null,"work_id":"a08e45e3-ecbc-49f1-afee-2672025cb8b7","year":2024},"citing_paper":{"arxiv_id":"2604.04579","last_updated":"2026-04-07T05:30:10Z","snapshot_observed_at":"2026-07-06T22:53:33.177713Z","submitted_at":"2026-04-06T10:25:16Z","title":"Firebolt-VL: Efficient Vision-Language Understanding with Cross-Modality Modulation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T19:01:18.334371Z"},"links":{"cited_paper":"/paper/2409.14818","citing_paper":"/paper/2604.04579"},"observation_digest":"sha256:98242c525d137aaafe1cb2183798f5cb6da6bc488e6a802575913902d41e68e6","observation_id":"254986cb-92e9-4b3f-888f-f47901f887d2","resolution":{"observed_at":"2026-05-10T23:35:50.681570Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2409.14818/citation-record","integrity":"/paper/2409.14818/integrity","json":"/paper/2409.14818/citation-record.json","paper":"/paper/2409.14818"},"outbound":[],"paper":{"arxiv_id":"2409.14818","last_updated":"2024-10-03T05:23:22Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-12T22:39:47.163392Z","submitted_at":"2024-09-23T08:47:54Z","title":"MobileVLM: A Vision-Language Model for Better Intra- and Inter-UI Understanding"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 8 inbound Pith citation observations for arXiv:2409.14818."}