{"as_of":"2026-08-14T23:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d5c459883adf8f5d1b476b219af7e31e75e71817bb212eb43671eb8bf35a5ea5","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T17:53:36.381720Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T21:10:19.033317Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T10:41:04.336073Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08443","snapshot_observed_at":"2026-08-10T21:10:19.033317Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-14T04:25:59.263298Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.033317Z"},"links":{"cited_paper":"/paper/2412.08443","citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:6d5dfe9164de66e7fbcb972954bb54d68a478267e843ad25127e2409aa0c0f9f","observation_id":"d6fcd753-8a4f-4a5f-ad9b-50ec0fa983de","resolution":{"observed_at":"2026-08-10T21:10:19.033317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08443","snapshot_observed_at":"2026-08-10T17:18:40.522131Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-14T20:27:26.429867Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.522131Z"},"links":{"cited_paper":"/paper/2412.08443","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:0dd3e3fcdcff385d0e518fe4a5a42fe4eab916337df411848c455a8c48dc6183","observation_id":"8995f9b6-2354-4758-aae2-58978eb21bde","resolution":{"observed_at":"2026-08-10T17:18:40.522131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08443","snapshot_observed_at":"2026-08-10T14:14:54.729437Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15558","last_updated":"2025-01-26T15:20:39Z","snapshot_observed_at":"2026-08-14T08:01:00.400549Z","submitted_at":"2025-01-26T15:20:39Z","title":"Ocean-OCR: Towards General OCR Application via a Vision-Language Model","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T14:14:54.729437Z"},"links":{"cited_paper":"/paper/2412.08443","citing_paper":"/paper/2501.15558"},"observation_digest":"sha256:1f81c01aa4290d060cdc485778a302a2aaea6413eedc5ae491e7f82ef6334c12","observation_id":"2ebea4e1-dbe9-44cd-aa48-b66c76f329cc","resolution":{"observed_at":"2026-08-10T14:14:54.729437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"cited_work":{"arxiv_id":"2412.08443","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.08443","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"5: Building a vision-language model towards real world applications","venue":null,"work_id":"0d3b4248-628b-4f9a-8b84-3fbaa300f0e9","year":2024},"citing_paper":{"arxiv_id":"2604.11627","last_updated":"2026-04-13T15:38:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-13T15:38:22Z","title":"POINTS-Long: Adaptive Dual-Mode Visual Reasoning in MLLMs","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:08.671342Z"},"links":{"cited_paper":"/paper/2412.08443","citing_paper":"/paper/2604.11627"},"observation_digest":"sha256:c3c96aec3abda967fdc4a56dd56c0ef4298db1c2fcbbf046e567c890fde5e215","observation_id":"f1f44d6b-23d1-46ab-b8a5-1dc68c20ceb4","resolution":{"observed_at":"2026-05-11T10:41:04.339239Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"cited_work":{"arxiv_id":"2412.08443","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.08443","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"5: Building a vision-language model towards real world applications","venue":null,"work_id":"0d3b4248-628b-4f9a-8b84-3fbaa300f0e9","year":2024},"citing_paper":{"arxiv_id":"2604.14029","last_updated":"2026-07-29T13:04:29Z","snapshot_observed_at":"2026-08-11T10:37:46.934045Z","submitted_at":"2026-04-15T16:09:37Z","title":"POINTS-Seeker: An Open Recipe for Multimodal Search Agents with Visual Memory Management","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T13:09:24.304696Z"},"links":{"cited_paper":"/paper/2412.08443","citing_paper":"/paper/2604.14029"},"observation_digest":"sha256:352083258372a9a66f0fffa0c59d123715f6df8910ad052ce8bf06d1cf55927a","observation_id":"978fed47-5263-4088-8de9-d7612181ca27","resolution":{"observed_at":"2026-05-10T13:10:26.364451Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08443","snapshot_observed_at":"2026-08-02T16:18:22.058395Z","title":"5: Building a vision-language model towards real world applications","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.14029","last_updated":"2026-07-29T13:04:29Z","snapshot_observed_at":"2026-08-11T10:37:46.934045Z","submitted_at":"2026-04-15T16:09:37Z","title":"POINTS-Seeker: An Open Recipe for Multimodal Search Agents with Visual Memory Management","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T16:18:22.058395Z"},"links":{"cited_paper":"/paper/2412.08443","citing_paper":"/paper/2604.14029"},"observation_digest":"sha256:26450a3d23e85b188aaa398427a3e91188921a8ce6162dd8dedce89bc1a0001c","observation_id":"8bf490b1-1558-4081-a933-75d550175b34","resolution":{"observed_at":"2026-08-02T16:18:22.058395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.08443/citation-record","integrity":"/paper/2412.08443/integrity","json":"/paper/2412.08443/citation-record.json","paper":"/paper/2412.08443"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-11T17:53:35.576467Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T17:53:35.576467Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2412.08443"},"observation_digest":"sha256:41cd1e27b3eec38fce6f7bd2c205cb863028a7b3cde0afd1f20e3fc4ac306482","observation_id":"98f326bd-d824-46b8-8c6f-03f5a4358a38","resolution":{"observed_at":"2026-08-11T17:53:35.576467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17297","last_updated":"2024-03-26T00:53:24Z","snapshot_observed_at":"2026-08-12T16:46:46.561976Z","submitted_at":"2024-03-26T00:53:24Z","title":"InternLM2 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17297","snapshot_observed_at":"2026-08-11T17:53:35.582276Z","title":"Internlm2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T17:53:35.582276Z"},"links":{"cited_paper":"/paper/2403.17297","citing_paper":"/paper/2412.08443"},"observation_digest":"sha256:b646595896252140faf3dd3fa1b815feb8dee9a4f99883e63069d9c481ad8319","observation_id":"fffee9bc-21d1-4932-8b30-6199ea5151be","resolution":{"observed_at":"2026-08-11T17:53:35.582276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10563","last_updated":"2025-07-13T23:07:08Z","snapshot_observed_at":"2026-08-14T07:31:29.641545Z","submitted_at":"2024-10-14T14:42:12Z","title":"MEGA-Bench: Scaling Multimodal Evaluation to over 500 Real-World Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10563","snapshot_observed_at":"2026-08-11T17:53:35.587371Z","title":"Mega-bench: Scaling multimodal evaluation to over 500 real-world tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T17:53:35.587371Z"},"links":{"cited_paper":"/paper/2410.10563","citing_paper":"/paper/2412.08443"},"observation_digest":"sha256:94fbd85e6a5caf68ce5d8a993bf02289cd064197fc729f438af7bc7c784fd1c2","observation_id":"4bbf6cd1-7f28-4e8e-8fd2-d03e9d4c631d","resolution":{"observed_at":"2026-08-11T17:53:35.587371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-11T17:53:35.591330Z","title":"Are we on the right way for evaluating large vision-language models? arXiv preprint arXiv:2403.20330, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T17:53:35.591330Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2412.08443"},"observation_digest":"sha256:6d6b7375c9de17479b41ba834d163614910eb018af643858c31590f72506fc7c","observation_id":"8a7755b8-4a17-44f0-ba00-f66d6d19457e","resolution":{"observed_at":"2026-08-11T17:53:35.591330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-11T17:53:35.595179Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T17:53:35.595179Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2412.08443"},"observation_digest":"sha256:9f96acf07e423686304e155d68cc89ae6dd422aa2391b225f7c795b98553516e","observation_id":"2b13e1ea-8a7d-4329-aff7-e811edf72d4b","resolution":{"observed_at":"2026-08-11T17:53:35.595179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:53:35.598976Z","title":"Opencompass: A universal evaluation platform for foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T17:53:35.598976Z"},"links":{"citing_paper":"/paper/2412.08443"},"observation_digest":"sha256:d87cf0e7f4aa89171765224f82d563f8b08a8719081664e39b6f42b1d3875d40","observation_id":"56929c1f-128c-4875-8c03-7304f608f8fd","resolution":{"observed_at":"2026-08-11T17:53:35.598976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11402","last_updated":"2024-10-22T23:13:34Z","snapshot_observed_at":"2026-08-12T22:43:01.323456Z","submitted_at":"2024-09-17T17:59:06Z","title":"NVLM: Open Frontier-Class Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11402","snapshot_observed_at":"2026-08-11T17:53:35.602293Z","title":"Nvlm: Open frontier-class multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T17:53:35.602293Z"},"links":{"cited_paper":"/paper/2409.11402","citing_paper":"/paper/2412.08443"},"observation_digest":"sha256:61faf9db99be0aa93db54836bc4bf4a7f84b1a08901fb897daf50002d57578b5","observation_id":"d3b610b1-d779-4dda-a0fe-b16a35b5f244","resolution":{"observed_at":"2026-08-11T17:53:35.602293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:53:35.606187Z","title":"Flash A ttention-2: Faster attention with better parallelism and work partitioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T17:53:35.606187Z"},"links":{"citing_paper":"/paper/2412.08443"},"observation_digest":"sha256:c69e1719b4b2e798edc8da11718c2fb5657e0c41c3942315fcdbd498406ea5df","observation_id":"63705407-a9b3-45c3-871e-4abcdab7546a","resolution":{"observed_at":"2026-08-11T17:53:35.606187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:53:35.609367Z","title":"Patch n’pack: Navit, a vision transformer for any aspect ratio and resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T17:53:35.609367Z"},"links":{"citing_paper":"/paper/2412.08443"},"observation_digest":"sha256:5e0aa4f7b75c7d66bb8299e7a8c43bd72845b54e26ddb466b7ac2eaadedf6b10","observation_id":"fa7d6077-5c4c-40ae-aaf9-5149cf7741da","resolution":{"observed_at":"2026-08-11T17:53:35.609367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16420","last_updated":"2024-01-29T18:59:02Z","snapshot_observed_at":"2026-08-05T03:42:54.599829Z","submitted_at":"2024-01-29T18:59:02Z","title":"InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16420","snapshot_observed_at":"2026-08-11T17:53:35.612707Z","title":"Internlm-xcomposer2: Mastering free-form text-image composition and comprehension in vision-language large model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T17:53:35.612707Z"},"links":{"cited_paper":"/paper/2401.16420","citing_paper":"/paper/2412.08443"},"observation_digest":"sha256:791e729e8dc95a0fcf766482387926baf8dbd1a1e18ceda3a2d4377a2386f50c","observation_id":"6f7540e0-44f8-4006-9bdc-593e85a1777a","resolution":{"observed_at":"2026-08-11T17:53:35.612707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06512","last_updated":"2024-04-09T17:59:32Z","snapshot_observed_at":"2026-08-13T17:48:34.710025Z","submitted_at":"2024-04-09T17:59:32Z","title":"InternLM-XComposer2-4KHD: A Pioneering Large Vision-Language Model Handling Resolutions from 336 Pixels to 4K HD","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06512","snapshot_observed_at":"2026-08-11T17:53:35.618990Z","title":"Internlm-xcomposer2-4khd: A pioneering large vision-language model handling resolutions from 336 pixels to 4k hd","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T17:53:35.618990Z"},"links":{"cited_paper":"/paper/2404.06512","citing_paper":"/paper/2412.08443"},"observation_digest":"sha256:71e8549bf8e0610f474a01aa91d4dedf43630b55c800caeafb45a7eae1580e69","observation_id":"5a6064f6-6ffd-448e-bde2-da149ef06fc6","resolution":{"observed_at":"2026-08-11T17:53:35.618990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T14:19:26.598265Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-11T17:53:35.623331Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T17:53:35.623331Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2412.08443"},"observation_digest":"sha256:261d93e0b65ff39af65a9a63bfa7214cf4b7254ded1b1baabb6342152d9404e2","observation_id":"8aa0ed58-c860-4f81-890e-b2152312c996","resolution":{"observed_at":"2026-08-11T17:53:35.623331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11691","last_updated":"2025-08-28T09:40:49Z","snapshot_observed_at":"2026-08-12T23:21:07.520817Z","submitted_at":"2024-07-16T13:06:15Z","title":"VLMEvalKit: An Open-Source Toolkit for Evaluating Large Multi-Modality Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11691","snapshot_observed_at":"2026-08-11T17:53:35.627431Z","title":"Vlmevalkit: An open-source toolkit for evaluating large multi-modality models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T17:53:35.627431Z"},"links":{"cited_paper":"/paper/2407.11691","citing_paper":"/paper/2412.08443"},"observation_digest":"sha256:fea501330d1b97ada45a5ce632f625e1e69334ba6cdf00f2aebf9d79638140ff","observation_id":"a8af7fbc-f283-488f-937e-0cb0f76f67e7","resolution":{"observed_at":"2026-08-11T17:53:35.627431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:53:35.659004Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T17:53:35.659004Z"},"links":{"citing_paper":"/paper/2412.08443"},"observation_digest":"sha256:89dd9ec63cf59d031cba5ee4e740e558e1f50bfa0699d53f1ab170c9563d422d","observation_id":"a49dc5aa-2bcc-4e25-a66d-81af93fc73fd","resolution":{"observed_at":"2026-08-11T17:53:35.659004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-08-13T19:48:28.322536Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-11T17:53:35.707889Z","title":"Gaussian error linear units (gelus)","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T17:53:35.707889Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2412.08443"},"observation_digest":"sha256:04c4035351098d37242590194fdc4fdd2e17975c1556f47910325a7e20b46ca6","observation_id":"7b1f3a07-e8c8-4486-841f-f83e4bda3359","resolution":{"observed_at":"2026-08-11T17:53:35.707889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:53:35.756491Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T17:53:35.756491Z"},"links":{"citing_paper":"/paper/2412.08443"},"observation_digest":"sha256:05760c8d3b3e0efd843d0f9b9bddac732c9569322ce20d7aa8517c8ffa289a54","observation_id":"e42ad58f-133b-4397-9030-1a3c2d1ad19c","resolution":{"observed_at":"2026-08-11T17:53:35.756491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1603.07396","last_updated":"2016-03-24T00:02:58Z","snapshot_observed_at":"2026-08-14T22:04:42.587173Z","submitted_at":"2016-03-24T00:02:58Z","title":"A Diagram Is Worth A Dozen Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1603.07396","snapshot_observed_at":"2026-08-11T17:53:35.785439Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T17:53:35.785439Z"},"links":{"cited_paper":"/paper/1603.07396","citing_paper":"/paper/2412.08443"},"observation_digest":"sha256:2c5ee60117c7d15fbdbeed9d4902949fd7c0ea782936710d819d137bd8143734","observation_id":"1dcf57e1-9e31-480f-8549-2dd20fc0b965","resolution":{"observed_at":"2026-08-11T17:53:35.785439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:53:37.037159Z","title":"Visual information extraction in the wild: practical dataset and end-to-end solution","venue":null,"work_id":"92d94d19-c087-4286-bc6c-3c6430877a9d","year":2023},"citing_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T17:53:35.824583Z"},"links":{"citing_paper":"/paper/2412.08443"},"observation_digest":"sha256:5b5fc3e26a0d876157012c56c16afa230c35879ff9b69ba35b6e3462837dd911","observation_id":"b7faf391-27ab-4a72-ae2d-11ac41cfa454","resolution":{"observed_at":"2026-08-11T17:53:37.041554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02246","last_updated":"2024-05-03T17:00:00Z","snapshot_observed_at":"2026-08-14T05:56:43.101287Z","submitted_at":"2024-05-03T17:00:00Z","title":"What matters when building vision-language models?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02246","snapshot_observed_at":"2026-08-11T17:53:35.917989Z","title":"What matters when building vision-language models? arXiv preprint arXiv:2405.02246, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T17:53:35.917989Z"},"links":{"cited_paper":"/paper/2405.02246","citing_paper":"/paper/2412.08443"},"observation_digest":"sha256:c6effce374413e967427216941dc6ba8f2f3093140d6962f6bb48e51cfebc8c0","observation_id":"9e8b26e7-b403-4696-a5c3-cb5433f133bf","resolution":{"observed_at":"2026-08-11T17:53:35.917989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-11T17:53:35.932406Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T17:53:35.932406Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2412.08443"},"observation_digest":"sha256:43221abefd61aa35abf8443e17ef064fe949a34849ade3388e5fb7eebd7f4612","observation_id":"78734d24-d5fc-4569-a79a-fd35d6b0bb42","resolution":{"observed_at":"2026-08-11T17:53:35.932406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-11T17:53:35.936447Z","title":"Seed-bench: Benchmarking multimodal llms with generative comprehension","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T17:53:35.936447Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2412.08443"},"observation_digest":"sha256:b4ce4fd2cff400860edd6767807b1fdfe4463cedeedbd8e52fb8a08f4c129300","observation_id":"36e10ffa-6e9b-4907-935e-5c3a439df210","resolution":{"observed_at":"2026-08-11T17:53:35.936447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:53:35.940354Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T17:53:35.940354Z"},"links":{"citing_paper":"/paper/2412.08443"},"observation_digest":"sha256:581b34696049497f40842acb38da87389cee28424a9c4e487480ea450ccfc024","observation_id":"0b6dc376-ad75-4176-82ef-fe4be5652c06","resolution":{"observed_at":"2026-08-11T17:53:35.940354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14566","last_updated":"2024-03-25T06:05:24Z","snapshot_observed_at":"2026-08-02T21:20:28.501823Z","submitted_at":"2023-10-23T04:49:09Z","title":"HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14566","snapshot_observed_at":"2026-08-11T17:53:35.944722Z","title":"Hallusionbench: You see what you think? or you think what you see? an image-context reasoning benchmark challenging for gpt-4v (ision), llava-1.5, and other multi-modality models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T17:53:35.944722Z"},"links":{"cited_paper":"/paper/2310.14566","citing_paper":"/paper/2412.08443"},"observation_digest":"sha256:320f0aa02b9882210f059665fd24aec82958a5bb50e717cf0d67fb12ddc72331","observation_id":"66370c34-82cf-4eb5-820f-232b96f1f9b0","resolution":{"observed_at":"2026-08-11T17:53:35.944722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:53:35.948644Z","title":"Improved baselines with visual instruction tuning, 2023 b","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T17:53:35.948644Z"},"links":{"citing_paper":"/paper/2412.08443"},"observation_digest":"sha256:710d6fd6f08ecda1cc422076813461b5c6032333dfc22791c343e475f9379d1f","observation_id":"071b681f-98c4-493c-8cdc-a50cb5a3afe0","resolution":{"observed_at":"2026-08-11T17:53:35.948644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:53:35.952889Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, January 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T17:53:35.952889Z"},"links":{"citing_paper":"/paper/2412.08443"},"observation_digest":"sha256:ad289507fbd1864290d95017a198467aaf54d76578ef7c4ff87192f86118ccde","observation_id":"77f76f56-d232-4a00-9c98-02436a04d336","resolution":{"observed_at":"2026-08-11T17:53:35.952889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:53:35.957433Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T17:53:35.957433Z"},"links":{"citing_paper":"/paper/2412.08443"},"observation_digest":"sha256:a93dbdc0fd98543a2b45dec6df808f428ebeff1ae14bdc9bd0a41603d867a863","observation_id":"972eac2e-bf3e-49cd-834e-783b58a4a2b6","resolution":{"observed_at":"2026-08-11T17:53:35.957433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-11T17:53:35.962357Z","title":"Mmbench: Is your multi-modal model an all-around player? arXiv preprint arXiv:2307.06281, 2023 c","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T17:53:35.962357Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2412.08443"},"observation_digest":"sha256:71b0832d649a0747b808e25babf8ca67dc15ca300b22c3327e2085a89db35341","observation_id":"f89b701e-93f5-4293-bae0-c0cfbdd33724","resolution":{"observed_at":"2026-08-11T17:53:35.962357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11850","last_updated":"2024-05-20T07:53:41Z","snapshot_observed_at":"2026-08-14T23:17:00.167129Z","submitted_at":"2024-05-20T07:53:41Z","title":"Rethinking Overlooked Aspects in Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2405.11850","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.11850","snapshot_observed_at":"2026-08-11T17:53:36.591124Z","title":"Rethinking Overlooked Aspects in Vision-Language Models","venue":"cs.CV","work_id":"c42b05a1-6d71-42e5-adec-4237eb95afc5","year":2024},"citing_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T17:53:35.966122Z"},"links":{"cited_paper":"/paper/2405.11850","citing_paper":"/paper/2412.08443"},"observation_digest":"sha256:f1fbcca4615953c611696e115648e089af4ad9610c40c797a8ef2ccfc7d6ccfb","observation_id":"a384600c-cc4b-499b-84dc-3b5cf5d34d46","resolution":{"observed_at":"2026-08-11T17:53:36.597445Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04828","last_updated":"2024-11-05T02:32:06Z","snapshot_observed_at":"2026-08-12T22:49:27.929514Z","submitted_at":"2024-09-07T13:41:37Z","title":"POINTS: Improving Your Vision-language Model with Affordable Strategies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04828","snapshot_observed_at":"2026-08-11T17:53:35.969925Z","title":"Points: Improving your vision-language model with affordable strategies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T17:53:35.969925Z"},"links":{"cited_paper":"/paper/2409.04828","citing_paper":"/paper/2412.08443"},"observation_digest":"sha256:c5d242a8f94d5058e3d272d0457b37be3ba76a972b7786cdde165acb9b6618ea","observation_id":"7951d8c8-f64f-4ccf-8f2b-5775eec7cce1","resolution":{"observed_at":"2026-08-11T17:53:35.969925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07895","last_updated":"2024-08-26T02:37:14Z","snapshot_observed_at":"2026-08-13T22:21:37.032118Z","submitted_at":"2023-05-13T11:28:37Z","title":"OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07895","snapshot_observed_at":"2026-08-11T17:53:35.973695Z","title":"On the hidden mystery of ocr in large multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T17:53:35.973695Z"},"links":{"cited_paper":"/paper/2305.07895","citing_paper":"/paper/2412.08443"},"observation_digest":"sha256:d9ac7ce87230498671ff92b909bb2fa25e0832e7381ca75c458b5033cf1ed2d3","observation_id":"50e3ba2d-8416-4470-b73b-fd21746959c4","resolution":{"observed_at":"2026-08-11T17:53:35.973695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:53:35.977503Z","title":"A convnet for the 2020s","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T17:53:35.977503Z"},"links":{"citing_paper":"/paper/2412.08443"},"observation_digest":"sha256:3d336cda199db24b7f911e5e4bf5b72720725ac45e4f866bf8aef7a1dfe01473","observation_id":"34f1136b-ad4d-4994-853d-951ba864696f","resolution":{"observed_at":"2026-08-11T17:53:35.977503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-11T01:38:59.827005Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-11T17:53:35.981062Z","title":"Deepseek-vl: towards real-world vision-language understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T17:53:35.981062Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2412.08443"},"observation_digest":"sha256:33905d4f8df2bb8816056daa8300c87c09eac192fe5ee2563a19cec013c17417","observation_id":"89baec70-f09e-44b5-93b8-14e1d436eaf7","resolution":{"observed_at":"2026-08-11T17:53:35.981062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:53:35.984662Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T17:53:35.984662Z"},"links":{"citing_paper":"/paper/2412.08443"},"observation_digest":"sha256:5bee491f4256794b52da80bac04967096ade1d5120337acc1a1699c3527be087","observation_id":"b327698e-fac0-4c8c-9161-75f40f9c3ca5","resolution":{"observed_at":"2026-08-11T17:53:35.984662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-11T17:53:35.988316Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T17:53:35.988316Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2412.08443"},"observation_digest":"sha256:5e9497ea035dd08edabcd40befdd36e21a9119d227584942ea43cd4d46fa33f8","observation_id":"2cd4dffa-a152-49c7-bf65-25aef7937ab0","resolution":{"observed_at":"2026-08-11T17:53:35.988316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-12T23:53:21.822871Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-11T17:53:35.992520Z","title":"Ovis: Structural embedding alignment for multimodal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T17:53:35.992520Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2412.08443"},"observation_digest":"sha256:7efb9bbd0ef4b736622f3592b672176a3e9dbb40fe7d9b4fc5147aebdf5813df","observation_id":"e226fb37-2f60-4d15-a93c-75819721536c","resolution":{"observed_at":"2026-08-11T17:53:35.992520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:53:36.943267Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge","venue":null,"work_id":"8a309ad2-31bc-48d2-a8fb-74d436f54504","year":2019},"citing_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T17:53:36.008926Z"},"links":{"citing_paper":"/paper/2412.08443"},"observation_digest":"sha256:5f0492c7a90a2dc8d44a9bd1fff56e6e66356a0f2a99c59b2852fb27d6a0a41a","observation_id":"cbfbed3c-8f3a-4141-b704-b929aba53ed1","resolution":{"observed_at":"2026-08-11T17:53:36.970221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-08-11T03:45:43.920485Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-11T17:53:36.092779Z","title":"Chartqa: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T17:53:36.092779Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2412.08443"},"observation_digest":"sha256:49e7115481b1de943f3a38703cb6395f2ba988ff05b13944460b8e126bb55aa9","observation_id":"5ad0b438-50a9-4792-af7c-3f1d36dec613","resolution":{"observed_at":"2026-08-11T17:53:36.092779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:53:36.894144Z","title":"Gpt-4 technical report","venue":null,"work_id":"5b707a13-430e-4ff6-92be-97db02f35dfb","year":2023},"citing_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T17:53:36.140019Z"},"links":{"citing_paper":"/paper/2412.08443"},"observation_digest":"sha256:7a2dd28e339d41215058143ce5a08f773975d46493b231de31bdd911fb39926c","observation_id":"8e8460d5-5ad4-421a-ac79-21eb1a002e51","resolution":{"observed_at":"2026-08-11T17:53:36.916367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:53:36.181095Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T17:53:36.181095Z"},"links":{"citing_paper":"/paper/2412.08443"},"observation_digest":"sha256:2898922c31bdf8de96b54f75068a0d31d86c5cc1cd18b5ffef5b7157c7f35dbe","observation_id":"fe849fcd-952f-4170-ab54-5f5683f44c81","resolution":{"observed_at":"2026-08-11T17:53:36.181095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1508.07909","last_updated":"2016-06-10T14:45:08Z","snapshot_observed_at":"2026-08-13T18:41:35.355818Z","submitted_at":"2015-08-31T16:37:31Z","title":"Neural Machine Translation of Rare Words with Subword Units","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1508.07909","snapshot_observed_at":"2026-08-11T17:53:36.228107Z","title":"Neural machine translation of rare words with subword units","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T17:53:36.228107Z"},"links":{"cited_paper":"/paper/1508.07909","citing_paper":"/paper/2412.08443"},"observation_digest":"sha256:abb374f883fdec28ebd7f05e715e03aace91f8c6346882e24257e9fd4255aeb6","observation_id":"f64f42bd-cfde-4509-8d8b-190a3f9fcf55","resolution":{"observed_at":"2026-08-11T17:53:36.228107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.15524","last_updated":"2021-10-05T22:18:32Z","snapshot_observed_at":"2026-08-14T08:37:40.498406Z","submitted_at":"2020-12-31T10:01:29Z","title":"Fast WordPiece Tokenization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.15524","snapshot_observed_at":"2026-08-11T17:53:36.267935Z","title":"Fast wordpiece tokenization","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T17:53:36.267935Z"},"links":{"cited_paper":"/paper/2012.15524","citing_paper":"/paper/2412.08443"},"observation_digest":"sha256:243de3142ce853c42f84bfa39c1f352095062125a9b142a9e2bdd694b3bec648","observation_id":"31dbbec2-e0c7-409c-964f-eb7c2e654e8b","resolution":{"observed_at":"2026-08-11T17:53:36.267935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:53:36.313185Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T17:53:36.313185Z"},"links":{"citing_paper":"/paper/2412.08443"},"observation_digest":"sha256:90b78440015928a42ce4a72cfc66a0e188fcc0633be3d663a410ccc2bbd86876","observation_id":"6f9a65c3-c770-4e2f-81ef-a00b446ac23d","resolution":{"observed_at":"2026-08-11T17:53:36.313185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-14T08:05:36.501358Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-08-11T17:53:36.335982Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T17:53:36.335982Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2412.08443"},"observation_digest":"sha256:91e03919282919a8c673fd2ed3de8599a538477d2b6d9743745aebe64479a85b","observation_id":"c14f66df-556f-4525-b716-5a3e9cc4b655","resolution":{"observed_at":"2026-08-11T17:53:36.335982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14804","last_updated":"2024-02-22T18:56:38Z","snapshot_observed_at":"2026-08-13T01:56:18.092262Z","submitted_at":"2024-02-22T18:56:38Z","title":"Measuring Multimodal Mathematical Reasoning with MATH-Vision Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14804","snapshot_observed_at":"2026-08-11T17:53:36.339878Z","title":"Measuring multimodal mathematical reasoning with math-vision dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T17:53:36.339878Z"},"links":{"cited_paper":"/paper/2402.14804","citing_paper":"/paper/2412.08443"},"observation_digest":"sha256:b2ae30cd871f50c56d4480ea27fe8c84cdb3d7d13a2d4326a60e8712f5829089","observation_id":"6318f71a-845c-4003-a7c7-672af8b109eb","resolution":{"observed_at":"2026-08-11T17:53:36.339878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-11T17:53:36.343951Z","title":"Qwen2-vl: Enhancing vision-language model's perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T17:53:36.343951Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2412.08443"},"observation_digest":"sha256:d33f20efc87f844e36901eda73e86ed5a821111c90964d44f700d50da1920d21","observation_id":"5b8fc23f-4cbb-4437-b08e-bff5cf8c03ac","resolution":{"observed_at":"2026-08-11T17:53:36.343951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-11T17:53:36.347655Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T17:53:36.347655Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2412.08443"},"observation_digest":"sha256:c801d90cdf9a28e85ed6b717862c3274e2d54708422085eade4f4fbaecbd8bae","observation_id":"50bf95f2-032e-4064-a534-321dc9d7cfd6","resolution":{"observed_at":"2026-08-11T17:53:36.347655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.05482","last_updated":"2022-07-01T23:48:19Z","snapshot_observed_at":"2026-08-13T16:25:25.521746Z","submitted_at":"2022-03-10T17:03:49Z","title":"Model soups: averaging weights of multiple fine-tuned models improves accuracy without increasing inference time","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.05482","snapshot_observed_at":"2026-08-11T17:53:36.351685Z","title":"Morcos, Hongseok Namkoong, Ali Farhadi, Yair Carmon, Simon Kornblith, and Ludwig Schmidt","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T17:53:36.351685Z"},"links":{"cited_paper":"/paper/2203.05482","citing_paper":"/paper/2412.08443"},"observation_digest":"sha256:8e7712bddaf29f288d1dcb983aa88e6a34e3073dcd8d8447a752e9d0945a2736","observation_id":"f8b086a8-c3ea-4660-859b-9ba04b5f2c90","resolution":{"observed_at":"2026-08-11T17:53:36.351685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-11T17:53:36.355481Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T17:53:36.355481Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2412.08443"},"observation_digest":"sha256:339402e4a81f168c0a358aea850e8284cb140c77a84dcb0deff921166d98adab","observation_id":"5ad075e0-148a-4e0e-8a89-62ddac381dfa","resolution":{"observed_at":"2026-08-11T17:53:36.355481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-11T17:53:36.359251Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T17:53:36.359251Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2412.08443"},"observation_digest":"sha256:ae923044e5f4f7fd7ef94b32d2d6294a89e37be9d910e46405de03369a48636b","observation_id":"d87c14d9-e5a4-4bf8-8b4d-0a8404ebbba0","resolution":{"observed_at":"2026-08-11T17:53:36.359251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13549","snapshot_observed_at":"2026-08-11T17:53:36.363033Z","title":"A survey on multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T17:53:36.363033Z"},"links":{"cited_paper":"/paper/2306.13549","citing_paper":"/paper/2412.08443"},"observation_digest":"sha256:5e1ce2c256aa85dbfbecdd53dd85a4c88de17d623ac5c344fb7a57a8d5fc0b64","observation_id":"af0f15c6-49b2-4c09-9a44-03c60e20f07b","resolution":{"observed_at":"2026-08-11T17:53:36.363033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:53:36.825752Z","title":"Capsfusion: Rethinking image-text data at scale","venue":null,"work_id":"275529da-36bf-4a72-8f38-e06731ca6d2f","year":2024},"citing_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T17:53:36.367287Z"},"links":{"citing_paper":"/paper/2412.08443"},"observation_digest":"sha256:2c013260803d7bcd6ba13ed2eed5ff28fa1bd47e1008f2a4ab8c9e74cb3eac7f","observation_id":"3ea851cd-f6f8-4c30-92d2-e3df83e2fb48","resolution":{"observed_at":"2026-08-11T17:53:36.849572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-08T03:31:37.699253Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-11T17:53:36.370595Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-11T17:53:36.370595Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2412.08443"},"observation_digest":"sha256:0d0139e761ac2500161135ee63246dcc9cbb03ad720ecca0311d8c3682d3d1e0","observation_id":"97b5a4a0-ffdf-47c8-8113-9a7a11592997","resolution":{"observed_at":"2026-08-11T17:53:36.370595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:53:36.374453Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-11T17:53:36.374453Z"},"links":{"citing_paper":"/paper/2412.08443"},"observation_digest":"sha256:428e40261a0eb51dcfe1d9a2be8ccdd4aa4398279872b6659dbbbffe88389152","observation_id":"48a51f39-2a3d-4042-8e4f-a36e24b4bfc3","resolution":{"observed_at":"2026-08-11T17:53:36.374453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20566","last_updated":"2024-09-30T17:59:34Z","snapshot_observed_at":"2026-08-14T09:55:01.826879Z","submitted_at":"2024-09-30T17:59:34Z","title":"MM1.5: Methods, Analysis & Insights from Multimodal LLM Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.20566","snapshot_observed_at":"2026-08-11T17:53:36.377753Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T17:53:36.377753Z"},"links":{"cited_paper":"/paper/2409.20566","citing_paper":"/paper/2412.08443"},"observation_digest":"sha256:8e8f0e180b85e4f9dbda007f2ec400fa77067005b51f9a46ce96d50486dca246","observation_id":"1c05cdad-49c4-4650-bc8f-06c059e545cc","resolution":{"observed_at":"2026-08-11T17:53:36.377753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:53:36.773278Z","title":"Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? In European Conference on Computer Vision, pages 169--186","venue":null,"work_id":"727c7b0f-ec67-4919-ba62-e9cb9011e733","year":2025},"citing_paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-11T17:53:36.381720Z"},"links":{"citing_paper":"/paper/2412.08443"},"observation_digest":"sha256:db1d4d855408ce14ffe49df8a4e303314006390c2c374896d65e605557d4fe8f","observation_id":"ff9fabc9-1e7e-4575-8c0a-7e6aa616fac1","resolution":{"observed_at":"2026-08-11T17:53:36.789081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.08443","last_updated":"2024-12-11T15:08:25Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T06:55:52.903310Z","submitted_at":"2024-12-11T15:08:25Z","title":"POINTS1.5: Building a Vision-Language Model towards Real World Applications"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":49,"verified_exact":1,"verified_fuzzy":5},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 6 inbound Pith citation observations for arXiv:2412.08443."}