{"as_of":"2026-08-09T15:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3c5cf27d2732e06efa09921b7de05f9c7459ee61a3aad4c14de1f6a2bcf85147","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":23,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T19:25:33.751527Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T10:35:41.926606Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.05437","last_updated":"2023-11-09T15:22:26Z","snapshot_observed_at":"2026-07-06T16:45:15.785513Z","submitted_at":"2023-11-09T15:22:26Z","title":"LLaVA-Plus: Learning to Use Tools for Creating Multimodal Agents","version":1},"cited_work":{"arxiv_id":"2311.05437","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.05437","snapshot_observed_at":"2026-07-01T10:35:41.926606Z","title":"Llava-plus: Learning to use tools for creating multimodal agents","venue":null,"work_id":"9c2031ce-7083-4715-8a00-67d6870081c8","year":2023},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"cited_paper":"/paper/2311.05437","citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:823793e2036bf35b00c297daf5aae72b10f6968b946f886827d13d98581edd66","observation_id":"b96c18cb-aa7d-4802-81af-1c9b31884c8a","resolution":{"observed_at":"2026-05-16T16:35:38.185520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05437","last_updated":"2023-11-09T15:22:26Z","snapshot_observed_at":"2026-07-06T16:45:15.785513Z","submitted_at":"2023-11-09T15:22:26Z","title":"LLaVA-Plus: Learning to Use Tools for Creating Multimodal Agents","version":1},"cited_work":{"arxiv_id":"2311.05437","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.05437","snapshot_observed_at":"2026-07-01T10:35:41.926606Z","title":"Llava-plus: Learning to use tools for creating multimodal agents","venue":null,"work_id":"9c2031ce-7083-4715-8a00-67d6870081c8","year":2023},"citing_paper":{"arxiv_id":"2402.00253","last_updated":"2024-05-06T01:10:01Z","snapshot_observed_at":"2026-07-06T17:23:26.913214Z","submitted_at":"2024-02-01T00:33:21Z","title":"A Survey on Hallucination in Large Vision-Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-13T22:10:10.186950Z"},"links":{"cited_paper":"/paper/2311.05437","citing_paper":"/paper/2402.00253"},"observation_digest":"sha256:7e32a84f02045a1dde37139e6073c89ae6e2559e71feae559b9adc2c39b1d961","observation_id":"4401e72f-91e8-4b34-a444-fad6f2db5712","resolution":{"observed_at":"2026-05-13T22:10:10.338212Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05437","last_updated":"2023-11-09T15:22:26Z","snapshot_observed_at":"2026-07-06T16:45:15.785513Z","submitted_at":"2023-11-09T15:22:26Z","title":"LLaVA-Plus: Learning to Use Tools for Creating Multimodal Agents","version":1},"cited_work":{"arxiv_id":"2311.05437","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.05437","snapshot_observed_at":"2026-07-01T10:35:41.926606Z","title":"Llava-plus: Learning to use tools for creating multimodal agents","venue":null,"work_id":"9c2031ce-7083-4715-8a00-67d6870081c8","year":2023},"citing_paper":{"arxiv_id":"2402.06196","last_updated":"2025-03-23T14:51:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-09T05:37:09Z","title":"Large Language Models: A Survey","version":3},"reference_index":217,"source":"pdf_text","source_observed_at":"2026-05-11T15:22:54.023279Z"},"links":{"cited_paper":"/paper/2311.05437","citing_paper":"/paper/2402.06196"},"observation_digest":"sha256:f1d593909e9fdf7dd417c1480261e7f3f15e14a1ed1aa58dc235619a58397a8b","observation_id":"ffb75772-aa49-4876-8637-f0066da0672e","resolution":{"observed_at":"2026-05-11T15:22:55.992348Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05437","last_updated":"2023-11-09T15:22:26Z","snapshot_observed_at":"2026-07-06T16:45:15.785513Z","submitted_at":"2023-11-09T15:22:26Z","title":"LLaVA-Plus: Learning to Use Tools for Creating Multimodal Agents","version":1},"cited_work":{"arxiv_id":"2311.05437","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.05437","snapshot_observed_at":"2026-07-01T10:35:41.926606Z","title":"Llava-plus: Learning to use tools for creating multimodal agents","venue":null,"work_id":"9c2031ce-7083-4715-8a00-67d6870081c8","year":2023},"citing_paper":{"arxiv_id":"2403.09611","last_updated":"2024-04-18T18:51:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-14T17:51:32Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","version":4},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-16T04:09:36.019146Z"},"links":{"cited_paper":"/paper/2311.05437","citing_paper":"/paper/2403.09611"},"observation_digest":"sha256:f64f7869edb40a8d45f96026c9a7ff19e8456190a228118c51f033cd848d54b2","observation_id":"1ffe80b4-f047-46b4-9bbf-997312599f30","resolution":{"observed_at":"2026-05-16T04:09:36.536840Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05437","last_updated":"2023-11-09T15:22:26Z","snapshot_observed_at":"2026-07-06T16:45:15.785513Z","submitted_at":"2023-11-09T15:22:26Z","title":"LLaVA-Plus: Learning to Use Tools for Creating Multimodal Agents","version":1},"cited_work":{"arxiv_id":"2311.05437","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.05437","snapshot_observed_at":"2026-07-01T10:35:41.926606Z","title":"Llava-plus: Learning to use tools for creating multimodal agents","venue":null,"work_id":"9c2031ce-7083-4715-8a00-67d6870081c8","year":2023},"citing_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:26.887069Z"},"links":{"cited_paper":"/paper/2311.05437","citing_paper":"/paper/2408.11039"},"observation_digest":"sha256:7635b49285d4f6d696a519bb41cebba2c0cd97758e0ff8a6f3af6f01083da1c9","observation_id":"66ac61e0-3ecd-462d-97f2-86c17d6da27b","resolution":{"observed_at":"2026-05-13T05:57:26.964174Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05437","last_updated":"2023-11-09T15:22:26Z","snapshot_observed_at":"2026-07-06T16:45:15.785513Z","submitted_at":"2023-11-09T15:22:26Z","title":"LLaVA-Plus: Learning to Use Tools for Creating Multimodal Agents","version":1},"cited_work":{"arxiv_id":"2311.05437","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.05437","snapshot_observed_at":"2026-07-01T10:35:41.926606Z","title":"Llava-plus: Learning to use tools for creating multimodal agents","venue":null,"work_id":"9c2031ce-7083-4715-8a00-67d6870081c8","year":2023},"citing_paper":{"arxiv_id":"2410.21169","last_updated":"2026-04-04T17:04:02Z","snapshot_observed_at":"2026-07-06T19:40:52.844113Z","submitted_at":"2024-10-28T16:11:35Z","title":"Document Parsing Unveiled: Techniques, Challenges, and Prospects for Structured Information Extraction","version":5},"reference_index":136,"source":"pdf_text","source_observed_at":"2026-05-23T19:15:21.695801Z"},"links":{"cited_paper":"/paper/2311.05437","citing_paper":"/paper/2410.21169"},"observation_digest":"sha256:00cb54f39eae29d729be2764d32ed0afca7b482aefc6290029781bbdc23b91c9","observation_id":"fd30c3a7-9fb9-4fe2-b9b9-cc64a6e87e46","resolution":{"observed_at":"2026-05-23T19:15:47.062053Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05437","last_updated":"2023-11-09T15:22:26Z","snapshot_observed_at":"2026-07-06T16:45:15.785513Z","submitted_at":"2023-11-09T15:22:26Z","title":"LLaVA-Plus: Learning to Use Tools for Creating Multimodal Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05437","snapshot_observed_at":"2026-08-07T19:25:33.751527Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10118","last_updated":"2025-09-04T15:00:25Z","snapshot_observed_at":"2026-08-09T06:44:20.576805Z","submitted_at":"2025-02-14T12:33:19Z","title":"Image Embedding Sampling Method for Diverse Captioning","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T19:25:33.751527Z"},"links":{"cited_paper":"/paper/2311.05437","citing_paper":"/paper/2502.10118"},"observation_digest":"sha256:88e219e6939e233dce7f16e1ef7df8e3f98270f6f8b3bd20f947e8d5dedf019e","observation_id":"c09a4593-00e2-4dac-b352-4eecbd225704","resolution":{"observed_at":"2026-08-07T19:25:33.751527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05437","last_updated":"2023-11-09T15:22:26Z","snapshot_observed_at":"2026-07-06T16:45:15.785513Z","submitted_at":"2023-11-09T15:22:26Z","title":"LLaVA-Plus: Learning to Use Tools for Creating Multimodal Agents","version":1},"cited_work":{"arxiv_id":"2311.05437","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.05437","snapshot_observed_at":"2026-07-01T10:35:41.926606Z","title":"Llava-plus: Learning to use tools for creating multimodal agents","venue":null,"work_id":"9c2031ce-7083-4715-8a00-67d6870081c8","year":2023},"citing_paper":{"arxiv_id":"2505.16416","last_updated":"2026-05-21T10:32:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T09:05:01Z","title":"Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Large Vision-Language Models","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-22T14:19:34.622854Z"},"links":{"cited_paper":"/paper/2311.05437","citing_paper":"/paper/2505.16416"},"observation_digest":"sha256:78f22b72501c4ddb791ee616ba033f917352f985986f1f940fb530c46a53fd60","observation_id":"42de5efa-0cb5-431a-83ba-d78fd3927afc","resolution":{"observed_at":"2026-05-22T14:21:39.732552Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05437","last_updated":"2023-11-09T15:22:26Z","snapshot_observed_at":"2026-07-06T16:45:15.785513Z","submitted_at":"2023-11-09T15:22:26Z","title":"LLaVA-Plus: Learning to Use Tools for Creating Multimodal Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05437","snapshot_observed_at":"2026-08-07T12:42:23.566141Z","title":"LLaV A-Plus: Learning to use tools for creating multimodal agents","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-08T00:05:10.710300Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:23.566141Z"},"links":{"cited_paper":"/paper/2311.05437","citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:774213324786208773591f1e0069b71724a4ef311b762debb251ef0cd2bf7640","observation_id":"5d56ce10-92a8-4789-9fc0-94d03b860da1","resolution":{"observed_at":"2026-08-07T12:42:23.566141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05437","last_updated":"2023-11-09T15:22:26Z","snapshot_observed_at":"2026-07-06T16:45:15.785513Z","submitted_at":"2023-11-09T15:22:26Z","title":"LLaVA-Plus: Learning to Use Tools for Creating Multimodal Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05437","snapshot_observed_at":"2026-08-07T05:26:59.109392Z","title":"Llava-plus: Learning to use tools for creating multi- modal agents.arXiv preprint arXiv:2311.05437, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08005","last_updated":"2025-06-09T17:59:51Z","snapshot_observed_at":"2026-08-07T05:18:07.539978Z","submitted_at":"2025-06-09T17:59:51Z","title":"ZeroVO: Visual Odometry with Minimal Assumptions","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:59.109392Z"},"links":{"cited_paper":"/paper/2311.05437","citing_paper":"/paper/2506.08005"},"observation_digest":"sha256:8cde877c9b5f379c359aeac3571c4bc3b386f1483762e7820a345bd49b91fbc7","observation_id":"b0e4dc90-d51d-4690-9e97-909398100931","resolution":{"observed_at":"2026-08-07T05:26:59.109392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05437","last_updated":"2023-11-09T15:22:26Z","snapshot_observed_at":"2026-07-06T16:45:15.785513Z","submitted_at":"2023-11-09T15:22:26Z","title":"LLaVA-Plus: Learning to Use Tools for Creating Multimodal Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05437","snapshot_observed_at":"2026-08-07T00:48:20.777371Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12594","last_updated":"2025-06-14T18:19:05Z","snapshot_observed_at":"2026-08-07T11:53:13.790399Z","submitted_at":"2025-06-14T18:19:05Z","title":"A Comprehensive Survey of Deep Research: Systems, Methodologies, and Applications","version":1},"reference_index":152,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:20.777371Z"},"links":{"cited_paper":"/paper/2311.05437","citing_paper":"/paper/2506.12594"},"observation_digest":"sha256:d7f62d485cd165580f74f3df8bd347022406b35d87d3fece9f7e6a01f020a006","observation_id":"4720f529-b09c-480a-a074-accdfeef8031","resolution":{"observed_at":"2026-08-07T00:48:20.777371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05437","last_updated":"2023-11-09T15:22:26Z","snapshot_observed_at":"2026-07-06T16:45:15.785513Z","submitted_at":"2023-11-09T15:22:26Z","title":"LLaVA-Plus: Learning to Use Tools for Creating Multimodal Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05437","snapshot_observed_at":"2026-08-06T19:25:02.756176Z","title":"Llava-plus: Learning to use tools for creating multi- modal agents","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-08T15:48:26.101646Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.756176Z"},"links":{"cited_paper":"/paper/2311.05437","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:bb8b98d4e1714a17cc2139dff819b36252ce39b5dcde29f8822156bd4e9b2847","observation_id":"b6798a7d-cf83-4917-bc88-4894cf994b78","resolution":{"observed_at":"2026-08-06T19:25:02.756176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05437","last_updated":"2023-11-09T15:22:26Z","snapshot_observed_at":"2026-07-06T16:45:15.785513Z","submitted_at":"2023-11-09T15:22:26Z","title":"LLaVA-Plus: Learning to Use Tools for Creating Multimodal Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05437","snapshot_observed_at":"2026-08-06T14:33:37.251420Z","title":"Llava-plus: Learning to use tools for creating multimodal agents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:37.251420Z"},"links":{"cited_paper":"/paper/2311.05437","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:2c4a5504139d93595fc85e2c7bcb8891d2be7b48c540c230fc6ee46e76d7453d","observation_id":"13d2176b-db56-4ac4-856e-40753e4f798d","resolution":{"observed_at":"2026-08-06T14:33:37.251420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05437","last_updated":"2023-11-09T15:22:26Z","snapshot_observed_at":"2026-07-06T16:45:15.785513Z","submitted_at":"2023-11-09T15:22:26Z","title":"LLaVA-Plus: Learning to Use Tools for Creating Multimodal Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05437","snapshot_observed_at":"2026-08-05T12:27:04.989084Z","title":"Llava-plus: Learning to use tools for creating multimodal agents, 2023 c","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01656","last_updated":"2025-09-01T17:57:49Z","snapshot_observed_at":"2026-08-06T02:38:32.042356Z","submitted_at":"2025-09-01T17:57:49Z","title":"Reinforced Visual Perception with Tools","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T12:27:04.989084Z"},"links":{"cited_paper":"/paper/2311.05437","citing_paper":"/paper/2509.01656"},"observation_digest":"sha256:5b17611dd0027dfd2d457b8f12cea7bb9ac3cb1be7e3ade249ff7443887e77e9","observation_id":"3665d3b9-926c-4d2e-9dea-54a19b7b8306","resolution":{"observed_at":"2026-08-05T12:27:04.989084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05437","last_updated":"2023-11-09T15:22:26Z","snapshot_observed_at":"2026-07-06T16:45:15.785513Z","submitted_at":"2023-11-09T15:22:26Z","title":"LLaVA-Plus: Learning to Use Tools for Creating Multimodal Agents","version":1},"cited_work":{"arxiv_id":"2311.05437","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.05437","snapshot_observed_at":"2026-07-01T10:35:41.926606Z","title":"Llava-plus: Learning to use tools for creating multimodal agents","venue":null,"work_id":"9c2031ce-7083-4715-8a00-67d6870081c8","year":2023},"citing_paper":{"arxiv_id":"2510.22102","last_updated":"2026-04-28T03:11:40Z","snapshot_observed_at":"2026-08-02T17:36:08.610766Z","submitted_at":"2025-10-25T00:58:47Z","title":"Mitigating Coordinate Prediction Bias from Positional Encoding Failures","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T05:11:30.734633Z"},"links":{"cited_paper":"/paper/2311.05437","citing_paper":"/paper/2510.22102"},"observation_digest":"sha256:08185aab5a6f6671c518ed61233c539234fbb589f7d668507cbc0fb52fd9f641","observation_id":"ae82f0c8-2299-4db5-8847-af159577028b","resolution":{"observed_at":"2026-05-18T05:12:23.519700Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05437","last_updated":"2023-11-09T15:22:26Z","snapshot_observed_at":"2026-07-06T16:45:15.785513Z","submitted_at":"2023-11-09T15:22:26Z","title":"LLaVA-Plus: Learning to Use Tools for Creating Multimodal Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05437","snapshot_observed_at":"2026-08-03T20:57:30.428570Z","title":"Llava-plus: Learning to use tools for creating multi- modal agents.arXiv preprint arXiv:2311.05437, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.17731","last_updated":"2026-06-30T21:37:31Z","snapshot_observed_at":"2026-08-03T20:57:27.147869Z","submitted_at":"2025-11-21T19:30:24Z","title":"VisReason: A Large-Scale Dataset for Visual Chain-of-Thought Reasoning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T20:57:30.428570Z"},"links":{"cited_paper":"/paper/2311.05437","citing_paper":"/paper/2511.17731"},"observation_digest":"sha256:df0e576d38af263f72a44f895443e40d7db12a6b3d14345251c0c853c2a4a5af","observation_id":"df93be91-3232-4a8c-b30b-18c5ae5848ed","resolution":{"observed_at":"2026-08-03T20:57:30.428570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05437","last_updated":"2023-11-09T15:22:26Z","snapshot_observed_at":"2026-07-06T16:45:15.785513Z","submitted_at":"2023-11-09T15:22:26Z","title":"LLaVA-Plus: Learning to Use Tools for Creating Multimodal Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05437","snapshot_observed_at":"2026-07-13T09:40:35.631188Z","title":"Llava-plus: Learning to use tools for creating mul- timodal agents.arXiv preprint arXiv:2311.05437,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.04834","last_updated":"2026-06-30T15:42:53Z","snapshot_observed_at":"2026-07-13T09:40:35.215938Z","submitted_at":"2026-04-06T16:35:57Z","title":"E-VLA: Event-Augmented Vision-Language-Action Model for Dark and Blurred Scenes","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-13T09:40:35.631188Z"},"links":{"cited_paper":"/paper/2311.05437","citing_paper":"/paper/2604.04834"},"observation_digest":"sha256:f0960e6e441c154531510ab869bd6bac4402cdddc3bf443b0bae673641ff856d","observation_id":"8089de90-037a-42c6-8409-83dbeba083cf","resolution":{"observed_at":"2026-07-13T09:40:35.631188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05437","last_updated":"2023-11-09T15:22:26Z","snapshot_observed_at":"2026-07-06T16:45:15.785513Z","submitted_at":"2023-11-09T15:22:26Z","title":"LLaVA-Plus: Learning to Use Tools for Creating Multimodal Agents","version":1},"cited_work":{"arxiv_id":"2311.05437","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.05437","snapshot_observed_at":"2026-07-01T10:35:41.926606Z","title":"Llava-plus: Learning to use tools for creating multimodal agents","venue":null,"work_id":"9c2031ce-7083-4715-8a00-67d6870081c8","year":2023},"citing_paper":{"arxiv_id":"2604.04838","last_updated":"2026-04-07T10:14:44Z","snapshot_observed_at":"2026-08-09T00:29:29.968171Z","submitted_at":"2026-04-06T16:41:19Z","title":"Less Detail, Better Answers: Degradation-Driven Prompting for VQA","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T20:17:01.867903Z"},"links":{"cited_paper":"/paper/2311.05437","citing_paper":"/paper/2604.04838"},"observation_digest":"sha256:4a84aee17e75bba97ebfa78f7bfe305c2bae1e89cb4254c13161fc63b4747d56","observation_id":"a3d56488-2b30-43f2-b2fe-443ab946a08e","resolution":{"observed_at":"2026-05-10T22:05:47.973219Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05437","last_updated":"2023-11-09T15:22:26Z","snapshot_observed_at":"2026-07-06T16:45:15.785513Z","submitted_at":"2023-11-09T15:22:26Z","title":"LLaVA-Plus: Learning to Use Tools for Creating Multimodal Agents","version":1},"cited_work":{"arxiv_id":"2311.05437","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.05437","snapshot_observed_at":"2026-07-01T10:35:41.926606Z","title":"Llava-plus: Learning to use tools for creating multimodal agents","venue":null,"work_id":"9c2031ce-7083-4715-8a00-67d6870081c8","year":2023},"citing_paper":{"arxiv_id":"2604.17475","last_updated":"2026-04-19T15:06:30Z","snapshot_observed_at":"2026-07-06T23:04:32.734175Z","submitted_at":"2026-04-19T15:06:30Z","title":"Waking Up Blind: Cold-Start Optimization of Supervision-Free Agentic Trajectories for Grounded Visual Perception","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T05:33:33.589721Z"},"links":{"cited_paper":"/paper/2311.05437","citing_paper":"/paper/2604.17475"},"observation_digest":"sha256:dc72ca0841b022a72dd13b1fedcc46ae63fc8c27f838b18236c212afd0bd00f2","observation_id":"ac93bcb1-9b2b-44dc-acb9-751745bcae77","resolution":{"observed_at":"2026-05-10T05:36:01.721126Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05437","last_updated":"2023-11-09T15:22:26Z","snapshot_observed_at":"2026-07-06T16:45:15.785513Z","submitted_at":"2023-11-09T15:22:26Z","title":"LLaVA-Plus: Learning to Use Tools for Creating Multimodal Agents","version":1},"cited_work":{"arxiv_id":"2311.05437","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.05437","snapshot_observed_at":"2026-07-01T10:35:41.926606Z","title":"Llava-plus: Learning to use tools for creating multimodal agents","venue":null,"work_id":"9c2031ce-7083-4715-8a00-67d6870081c8","year":2023},"citing_paper":{"arxiv_id":"2605.16165","last_updated":"2026-05-15T16:45:56Z","snapshot_observed_at":"2026-07-06T23:27:20.429737Z","submitted_at":"2026-05-15T16:45:56Z","title":"Second-Order Multi-Level Variance Correction for Modality Competition in Multimodal Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-20T19:02:02.266052Z"},"links":{"cited_paper":"/paper/2311.05437","citing_paper":"/paper/2605.16165"},"observation_digest":"sha256:818a29b88d098506aff61b80aec5c391d624a7c4222a772656e4235d7f6ca89e","observation_id":"b24b2b45-f5a1-4dce-8f76-ad08bd6af5a0","resolution":{"observed_at":"2026-05-20T19:03:39.571289Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05437","last_updated":"2023-11-09T15:22:26Z","snapshot_observed_at":"2026-07-06T16:45:15.785513Z","submitted_at":"2023-11-09T15:22:26Z","title":"LLaVA-Plus: Learning to Use Tools for Creating Multimodal Agents","version":1},"cited_work":{"arxiv_id":"2311.05437","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.05437","snapshot_observed_at":"2026-07-01T10:35:41.926606Z","title":"Llava-plus: Learning to use tools for creating multimodal agents","venue":null,"work_id":"9c2031ce-7083-4715-8a00-67d6870081c8","year":2023},"citing_paper":{"arxiv_id":"2605.20682","last_updated":"2026-05-20T03:52:21Z","snapshot_observed_at":"2026-08-02T13:01:00.493889Z","submitted_at":"2026-05-20T03:52:21Z","title":"IndusAgent: Reinforcing Open-Vocabulary Industrial Anomaly Detection with Agentic Tools","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-21T05:33:30.670201Z"},"links":{"cited_paper":"/paper/2311.05437","citing_paper":"/paper/2605.20682"},"observation_digest":"sha256:03b958fdbadff4e8c80ced59a5dfb0b64823f8e6a87ff0a453645a18b6d16040","observation_id":"45a2a72a-1e30-471f-b9a5-d41b606ec131","resolution":{"observed_at":"2026-05-21T05:33:58.501835Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05437","last_updated":"2023-11-09T15:22:26Z","snapshot_observed_at":"2026-07-06T16:45:15.785513Z","submitted_at":"2023-11-09T15:22:26Z","title":"LLaVA-Plus: Learning to Use Tools for Creating Multimodal Agents","version":1},"cited_work":{"arxiv_id":"2311.05437","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.05437","snapshot_observed_at":"2026-07-01T10:35:41.926606Z","title":"Llava-plus: Learning to use tools for creating multimodal agents","venue":null,"work_id":"9c2031ce-7083-4715-8a00-67d6870081c8","year":2023},"citing_paper":{"arxiv_id":"2606.31392","last_updated":"2026-06-30T09:19:38Z","snapshot_observed_at":"2026-07-07T00:05:07.912609Z","submitted_at":"2026-06-30T09:19:38Z","title":"ReGRPO: Reflection-Augmented Policy Optimization for Tool-Using Agents","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-01T05:23:21.162004Z"},"links":{"cited_paper":"/paper/2311.05437","citing_paper":"/paper/2606.31392"},"observation_digest":"sha256:c6d10b9c245f206c18950b1b9fe47f7d97cfbd06d9c693db5f3532331e71e277","observation_id":"d590c960-c4d2-457b-942d-8adab7f652f6","resolution":{"observed_at":"2026-07-01T10:35:41.928986Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05437","last_updated":"2023-11-09T15:22:26Z","snapshot_observed_at":"2026-07-06T16:45:15.785513Z","submitted_at":"2023-11-09T15:22:26Z","title":"LLaVA-Plus: Learning to Use Tools for Creating Multimodal Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05437","snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"arXiv preprint arXiv:2311.05437 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":216,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"cited_paper":"/paper/2311.05437","citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:11048ef522a08ec89f3647b3a3898979cb49c48c88537b5be9f2f8bf3641fc58","observation_id":"61b9a200-a680-4ee8-b4db-2cd88dac3504","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2311.05437/citation-record","integrity":"/paper/2311.05437/integrity","json":"/paper/2311.05437/citation-record.json","paper":"/paper/2311.05437"},"outbound":[],"paper":{"arxiv_id":"2311.05437","last_updated":"2023-11-09T15:22:26Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T16:45:15.785513Z","submitted_at":"2023-11-09T15:22:26Z","title":"LLaVA-Plus: Learning to Use Tools for Creating Multimodal Agents"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 23 inbound Pith citation observations for arXiv:2311.05437."}