{"as_of":"2026-08-15T10:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9e86c6f8795fe8ec503c65895fc6fd951f017bfdcd689c702372758334327fb8","coverage":[{"denominator":137,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:50:05.568237Z","state":"measured"},{"denominator":102,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":102,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T05:12:37.339084Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-13T05:17:18.750827Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2507.12566","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.12566","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mono-internvl-1.5: Towards cheaper and faster monolithic multimodal large language models","venue":null,"work_id":"c454767e-76df-46b9-af2d-e54cf575b057","year":2025},"citing_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-08-13T04:48:56.237545Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-10T11:58:58.660564Z"},"links":{"cited_paper":"/paper/2507.12566","citing_paper":"/paper/2508.18265"},"observation_digest":"sha256:cb9058382449222324a797398ea98d7402f53711c016744f76638c19fc2f003e","observation_id":"fe67a2ae-8c0f-4042-abb3-5246f5c6fee4","resolution":{"observed_at":"2026-05-10T11:58:59.202761Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2507.12566","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.12566","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mono-internvl-1.5: Towards cheaper and faster monolithic multimodal large language models","venue":null,"work_id":"c454767e-76df-46b9-af2d-e54cf575b057","year":2025},"citing_paper":{"arxiv_id":"2605.12500","last_updated":"2026-05-12T17:59:58Z","snapshot_observed_at":"2026-07-06T23:24:13.851504Z","submitted_at":"2026-05-12T17:59:58Z","title":"SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-13T05:12:37.339084Z"},"links":{"cited_paper":"/paper/2507.12566","citing_paper":"/paper/2605.12500"},"observation_digest":"sha256:aa56ffe990c71852ac16dc379681c174da6d0e0ba4c20e20caf00f091431de1b","observation_id":"85ce1315-55db-4859-9f18-b28e63813223","resolution":{"observed_at":"2026-05-13T05:17:18.752838Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.12566/citation-record","integrity":"/paper/2507.12566/integrity","json":"/paper/2507.12566/citation-record.json","paper":"/paper/2507.12566"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T16:49:55.260899Z","title":"GPT-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:55.260899Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:c935e65a1c738a6f8a26d269b8bcf51481cbe2de977af731a45bcfea8ea3eb4d","observation_id":"235b395d-36c4-4a87-86a8-8c3e66eb72d8","resolution":{"observed_at":"2026-08-06T16:49:55.260899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-06T16:49:55.431651Z","title":"Qwen technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:55.431651Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:12511fb49f94ca1c9bb02f71809a70e6e813f7e641cf8a2e9a4e87e1c4cb3058","observation_id":"d9774078-184d-4460-83d9-23b4956496b9","resolution":{"observed_at":"2026-08-06T16:49:55.431651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17297","last_updated":"2024-03-26T00:53:24Z","snapshot_observed_at":"2026-08-12T16:46:46.561976Z","submitted_at":"2024-03-26T00:53:24Z","title":"InternLM2 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17297","snapshot_observed_at":"2026-08-06T16:49:55.597995Z","title":"Internlm2 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:55.597995Z"},"links":{"cited_paper":"/paper/2403.17297","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:2d4bffb2a55040e2fe8b67bbe414bbaef444587721aac89ff44a00ed42c25a07","observation_id":"b0b86d26-1227-476b-8a16-ea8ab9088e16","resolution":{"observed_at":"2026-08-06T16:49:55.597995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:55.726783Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:55.726783Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:e58640226e6b3162413720c48c83fb35d4ebb6ff7f1e649f7d68f04bbae3d22c","observation_id":"c183d979-6b75-4a40-bd9a-0dafa73d6666","resolution":{"observed_at":"2026-08-06T16:49:55.726783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:55.834849Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:55.834849Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:84813b75c045378e56b1293f5b2a50af309b3769b1e2162b6d491d2a3de7daa3","observation_id":"e0901f71-40b2-4641-908e-c290254308de","resolution":{"observed_at":"2026-08-06T16:49:55.834849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-06T16:49:55.905181Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:55.905181Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:206d49ad6925f056993993ec694a4d07eb5b662ff3c3aa906a67178c44b3cfef","observation_id":"3ae42cdb-16e2-4436-966e-725c985a3d53","resolution":{"observed_at":"2026-08-06T16:49:55.905181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:56.005313Z","title":"BLIP-2: bootstrapping language-image pre-training with frozen image encoders and large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:56.005313Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:d98e8546295421b51759388c01e389f66e285e0678ff210234d1fe5cae36551c","observation_id":"ac57a490-84dc-4135-9514-b86f724a33e8","resolution":{"observed_at":"2026-08-06T16:49:56.005313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:56.084702Z","title":"Introducing our multimodal models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:56.084702Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:ee39c4e7d04a550ef9b2a87b1800a54cac726393e2df63b15dec8ee0fd9da70a","observation_id":"9c7033a1-d62d-4e9a-9189-9f5e541158b9","resolution":{"observed_at":"2026-08-06T16:49:56.084702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-12T23:40:46.200424Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-06T16:49:56.218152Z","title":"Unveiling encoder-free vision-language models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:56.218152Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:986bb52f0ed48baee061a6f5a4519bde3cd7fe21cc430592e8bc9b93c0f88d48","observation_id":"31e4b70e-3842-4761-9ffd-58b30ea63fba","resolution":{"observed_at":"2026-08-06T16:49:56.218152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06438","last_updated":"2024-12-13T23:11:31Z","snapshot_observed_at":"2026-08-12T23:26:17.661596Z","submitted_at":"2024-07-08T22:40:15Z","title":"SOLO: A Single Transformer for Scalable Vision-Language Modeling","version":3},"cited_work":{"arxiv_id":"2407.06438","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.06438","snapshot_observed_at":"2026-08-06T16:50:10.233691Z","title":"SOLO: A Single Transformer for Scalable Vision-Language Modeling","venue":"cs.CV","work_id":"502d8ac0-31a5-40d6-838e-82597f85a7ea","year":2024},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:56.373596Z"},"links":{"cited_paper":"/paper/2407.06438","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:7b0cfc8d58d8f00a60b51db283136a34652d68bfed8270f550d08cb269655b50","observation_id":"1c525bd1-5ec4-4b4f-9005-06ab4929f066","resolution":{"observed_at":"2026-08-06T16:50:10.351624Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:56.460558Z","title":"Mono-internvl: Pushing the boundaries of monolithic multimodal large language models with endogenous visual pre-training,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:56.460558Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:fa19a73914a9c1d8ee8ed2c60b7f653338b364c9074d61b4afde616534ce61db","observation_id":"23b62d2c-270b-4f8c-8d6d-96db9f90abcd","resolution":{"observed_at":"2026-08-06T16:49:56.460558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-06T16:49:56.572596Z","title":"Chameleon: Mixed-modal early-fusion foundation models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:56.572596Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:becb4cfefe2383e0512e3d3c4eb830a2edd1803a404b931c124ecd9e663fa2e2","observation_id":"d4dfeccd-4672-44a9-8db0-229275532d35","resolution":{"observed_at":"2026-08-06T16:49:56.572596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10313","last_updated":"2023-12-05T08:59:33Z","snapshot_observed_at":"2026-08-13T14:29:50.623753Z","submitted_at":"2023-09-19T04:51:13Z","title":"Investigating the Catastrophic Forgetting in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10313","snapshot_observed_at":"2026-08-06T16:49:56.665670Z","title":"Investigating the catastrophic forgetting in multimodal large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:56.665670Z"},"links":{"cited_paper":"/paper/2309.10313","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:d0f1de3a008cc61ac73c358abb72b0e95aeaa139008f9ee61c9a48a251e9a659","observation_id":"df089f74-f30b-44f3-a10f-2de6df635cdf","resolution":{"observed_at":"2026-08-06T16:49:56.665670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.06904","last_updated":"2022-03-15T01:22:04Z","snapshot_observed_at":"2026-08-14T04:13:11.821456Z","submitted_at":"2022-03-14T07:56:32Z","title":"Delta Tuning: A Comprehensive Study of Parameter Efficient Methods for Pre-trained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.06904","snapshot_observed_at":"2026-08-06T16:49:56.785510Z","title":"Delta tuning: A comprehensive study of parameter efficient methods for pre-trained language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:56.785510Z"},"links":{"cited_paper":"/paper/2203.06904","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:8918b3cb84c025dd809f99097709f9cdea5455954d3cc385840161617720bfa7","observation_id":"2cffd4b2-6780-4103-aa7f-85eca601f8e6","resolution":{"observed_at":"2026-08-06T16:49:56.785510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T16:49:56.896912Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:56.896912Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:424f3204752aa0b0fe51396380c0b3b6860f810b726b2e7e5daca3fffed16f55","observation_id":"73aee5ed-f683-4926-a808-79f3ecb4aa9b","resolution":{"observed_at":"2026-08-06T16:49:56.896912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:56.999030Z","title":"Lima: Less is more for alignment,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:56.999030Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:79e6869b83a963da50334f275d1cbbecf20bfae6ffe25f4b632bb2e0bb5cee2e","observation_id":"93868ee2-dba0-452c-8fd9-2d19ae9d9976","resolution":{"observed_at":"2026-08-06T16:49:56.999030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-06T16:49:57.069428Z","title":"Emu3: Next-token prediction is all you need,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:57.069428Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:b53aa430ab6d9863fc7025d48c16f9618f0f04258f23026367971da822121009","observation_id":"27ad4242-fc85-46d9-a397-83c596813eed","resolution":{"observed_at":"2026-08-06T16:49:57.069428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17421","last_updated":"2023-10-11T05:07:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:34:51Z","title":"The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17421","snapshot_observed_at":"2026-08-06T16:49:57.153253Z","title":"The dawn of lmms: Preliminary explorations with gpt-4v (ision),","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:57.153253Z"},"links":{"cited_paper":"/paper/2309.17421","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:6dfdac67bce30c18ee4e97f8357108048e240a8a24fe7c69ac9b4042e231be56","observation_id":"901c8ced-76a7-47a9-93e0-abdc860ade0e","resolution":{"observed_at":"2026-08-06T16:49:57.153253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T16:49:57.248846Z","title":"Gemini: a family of highly capable multimodal models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:57.248846Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:7d7c1881b1e5073f8112d8ecbede103ccf57048517d7d73810c9200a6b997a23","observation_id":"4c338e29-89b5-40fe-980e-4969d4907720","resolution":{"observed_at":"2026-08-06T16:49:57.248846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-08-15T02:35:59.111911Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-06T16:49:57.353167Z","title":"Improved baselines with visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:57.353167Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:e0e00332841d2eb3a332ae6d0e1c4c090018e37e38feb887f747693d04a62f32","observation_id":"220026a1-5a60-44c4-8099-462afadca072","resolution":{"observed_at":"2026-08-06T16:49:57.353167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-08-15T01:58:37.525169Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-08-06T16:49:57.463091Z","title":"Feast your eyes: Mixture-of-resolution adaptation for multimodal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:57.463091Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:49c38e2a717f42065fd6ed11ee7b425c45053560ec2f93ead2b7726782d1b1c2","observation_id":"0f625dc8-cdfc-42c1-9448-9668a4a65cfd","resolution":{"observed_at":"2026-08-06T16:49:57.463091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07783","last_updated":"2025-01-14T01:57:41Z","snapshot_observed_at":"2026-08-13T12:18:56.180630Z","submitted_at":"2025-01-14T01:57:41Z","title":"Parameter-Inverted Image Pyramid Networks for Visual Perception and Multimodal Understanding","version":1},"cited_work":{"arxiv_id":"2501.07783","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.07783","snapshot_observed_at":"2026-08-06T16:50:09.964594Z","title":"Parameter-Inverted Image Pyramid Networks for Visual Perception and Multimodal Understanding","venue":"cs.CV","work_id":"aaeefb6d-84e6-4a1a-9fdf-f3d93d52d694","year":2025},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:57.683627Z"},"links":{"cited_paper":"/paper/2501.07783","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:e46dfbe2528428320286aa0fd15105c29c556738dbb5a3c125c94d35ee58e9d4","observation_id":"cc75399e-c724-46e9-8338-dbd706c97401","resolution":{"observed_at":"2026-08-06T16:50:10.051759Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09604","last_updated":"2024-12-12T18:59:26Z","snapshot_observed_at":"2026-08-13T21:41:53.471697Z","submitted_at":"2024-12-12T18:59:26Z","title":"SynerGen-VL: Towards Synergistic Image Understanding and Generation with Vision Experts and Token Folding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09604","snapshot_observed_at":"2026-08-06T16:49:57.751825Z","title":"Synergen-vl: Towards synergistic image understanding and generation with vision experts and token folding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:57.751825Z"},"links":{"cited_paper":"/paper/2412.09604","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:b317086eae55a37a4d54ab378139357524cc84294a50148c445a59c46e6f4d1d","observation_id":"718b4b77-42d6-4f16-baa8-b702afb4b3c8","resolution":{"observed_at":"2026-08-06T16:49:57.751825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:57.862972Z","title":"BLIP: bootstrapping language-image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:57.862972Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:704f7304647db0d6f7ad90b00711cfc3c5c45e076e21c14f2880b4b7df182825","observation_id":"f5a625a0-61af-40c6-b69e-ed10033673fa","resolution":{"observed_at":"2026-08-06T16:49:57.862972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:57.985266Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:57.985266Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:cde65535998472901aadb5112f6ac46eb67dc82923d2f870046d37b586a131ba","observation_id":"b6ab71c8-d911-40a6-8d89-4ef5fba23175","resolution":{"observed_at":"2026-08-06T16:49:57.985266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:58.074139Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:58.074139Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:87f11dbcfcc96b661bdee06ac24d198f2fae79191f41e913ac79d5946b85ff23","observation_id":"dab453f1-892f-41b9-9259-186e59988c55","resolution":{"observed_at":"2026-08-06T16:49:58.074139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T16:49:58.168347Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:58.168347Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:d866415ea3ccf47abf376df2df8e152fc4c66f4d1ae1936e0a4867118fc9e462","observation_id":"f68fdac2-7f06-4dfa-a0b8-6f5c56f104dd","resolution":{"observed_at":"2026-08-06T16:49:58.168347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T16:49:58.311277Z","title":"Qwen2. 5-vl technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:58.311277Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:a3febe87f3fd153c1a92703b171151c5237bae1f7f304bd496e555ddb7344d7f","observation_id":"df391df8-6293-45c1-b131-2b8d35f1e3a7","resolution":{"observed_at":"2026-08-06T16:49:58.311277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-06T16:49:58.390094Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:58.390094Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:90ee050d4fe9217449c6e0c1eccf561f4c9672d25e0082f271e61dffad50e7e0","observation_id":"202f1580-fc12-439a-8af0-3029d2195b70","resolution":{"observed_at":"2026-08-06T16:49:58.390094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10442","last_updated":"2025-04-07T09:09:39Z","snapshot_observed_at":"2026-08-13T18:24:04.904767Z","submitted_at":"2024-11-15T18:59:27Z","title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10442","snapshot_observed_at":"2026-08-06T16:49:58.597304Z","title":"Enhancing the reasoning ability of multimodal MONO-INTERNVL-1.5 14 large language models via mixed preference optimization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:58.597304Z"},"links":{"cited_paper":"/paper/2411.10442","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:1b511d54a97cbbe71fe0d154f12c18d7b8f605325ce52a675d31f51d809c7e89","observation_id":"871361c5-bde1-4422-8f1b-ebb842a6a0b1","resolution":{"observed_at":"2026-08-06T16:49:58.597304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:58.697634Z","title":"Mini-internvl: a flexible-transfer pocket multi-modal model with 5% parameters and 90% performance,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:58.697634Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:cfa38ae19b43bb473e7354b705f8cff7da9ecc53f05fd9453140f2541a16b469","observation_id":"8eba6607-61ef-454b-a467-b2be0c2d9381","resolution":{"observed_at":"2026-08-06T16:49:58.697634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T16:49:58.800042Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:58.800042Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:1115882eb367e5a67730ae8f107d1844690eb7a4b6f2d92773a8a453ba002569","observation_id":"63a1e2a6-3313-4851-9e28-bdd64ec2e4a3","resolution":{"observed_at":"2026-08-06T16:49:58.800042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T16:49:58.881346Z","title":"Llama 2: Open foundation and fine-tuned chat models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:58.881346Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:8f4f0d6bea32a277ca75a8c2f4ef501f6ba1838fe1fc10cb3ed2179f3d80979c","observation_id":"730f0235-ff65-47e0-b3e4-822e238e42da","resolution":{"observed_at":"2026-08-06T16:49:58.881346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:58.977983Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:58.977983Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:5c702e424d0ba5440820ecec4b019905afd95b4a8b9339e6bd50f8b3df4f988d","observation_id":"0244e7a9-46d2-49e3-86a4-682e461f0b46","resolution":{"observed_at":"2026-08-06T16:49:58.977983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12528","last_updated":"2025-09-08T02:42:57Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T16:32:32Z","title":"Show-o: One Single Transformer to Unify Multimodal Understanding and Generation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12528","snapshot_observed_at":"2026-08-06T16:49:59.055806Z","title":"Show-o: One single transformer to unify multimodal understanding and generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:59.055806Z"},"links":{"cited_paper":"/paper/2408.12528","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:1a5b4a4917c163412b860de524f026635dbd923379991f4e867e38fb6fd0e49a","observation_id":"7e7d78cb-6aef-4d4a-8d55-1fea0f4b1312","resolution":{"observed_at":"2026-08-06T16:49:59.055806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-08-11T01:34:46.484513Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-06T16:49:59.135515Z","title":"Transfusion: Predict the next token and diffuse images with one multi-modal model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:59.135515Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:99e4d0ed6aac64410fad26385869a983582eb6daeaed65651e9be8ea59b53c3d","observation_id":"bed0b7ad-391e-4c43-bca4-ac6c35dda569","resolution":{"observed_at":"2026-08-06T16:49:59.135515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:59.224871Z","title":"Vlmo: Unified vision-language pre-training with mixture-of-modality-experts,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:59.224871Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:57a3e983b654814521a59bc0aa787a097492191eed2721218f2ad1eaf4c874d2","observation_id":"2dde65db-d26c-4439-b13c-a083fc6b3b8d","resolution":{"observed_at":"2026-08-06T16:49:59.224871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.10442","last_updated":"2022-08-31T02:26:45Z","snapshot_observed_at":"2026-08-13T14:40:51.995893Z","submitted_at":"2022-08-22T16:55:04Z","title":"Image as a Foreign Language: BEiT Pretraining for All Vision and Vision-Language Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.10442","snapshot_observed_at":"2026-08-06T16:49:59.336128Z","title":"Image as a foreign language: Beit pretraining for all vision and vision-language tasks,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:59.336128Z"},"links":{"cited_paper":"/paper/2208.10442","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:be7c46248f2ac69ada9fc1c714651cb68824adb33c7ddf27effe552d8a4914d5","observation_id":"1fe92c26-84cd-40aa-97f4-5e7386379e26","resolution":{"observed_at":"2026-08-06T16:49:59.336128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.07226","last_updated":"2023-03-13T16:00:31Z","snapshot_observed_at":"2026-08-13T12:25:38.424028Z","submitted_at":"2023-03-13T16:00:31Z","title":"Scaling Vision-Language Models with Sparse Mixture of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.07226","snapshot_observed_at":"2026-08-06T16:49:59.424967Z","title":"Scaling vision-language models with sparse mixture of experts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:59.424967Z"},"links":{"cited_paper":"/paper/2303.07226","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:b7de2782691cdf74691610f366de70b42cfafd30f98eb7726427b75348f1fcd2","observation_id":"3e3f5af5-d0c2-4d93-89e5-8a1fe41310a5","resolution":{"observed_at":"2026-08-06T16:49:59.424967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:59.548683Z","title":"Twenty years of mixture of experts,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:59.548683Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:a4e1cf252d44f66cea6fd475277948b2619918a19d33eb85c30200144def3848","observation_id":"f5284dae-5a57-4d0b-9d5d-eb743de78905","resolution":{"observed_at":"2026-08-06T16:49:59.548683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21770","last_updated":"2024-08-12T16:20:37Z","snapshot_observed_at":"2026-08-13T18:50:18.193476Z","submitted_at":"2024-07-31T17:46:51Z","title":"MoMa: Efficient Early-Fusion Pre-training with Mixture of Modality-Aware Experts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21770","snapshot_observed_at":"2026-08-06T16:49:59.656307Z","title":"Moma: Efficient early-fusion pre-training with mixture of modality-aware experts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:59.656307Z"},"links":{"cited_paper":"/paper/2407.21770","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:7d48f1b5e1234edb9c4afd924c3bf635067af07fb95c68a58a69adfefef5e02f","observation_id":"0a5d6262-037d-431e-83b5-cee3b08144d0","resolution":{"observed_at":"2026-08-06T16:49:59.656307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02258","last_updated":"2024-04-02T19:28:11Z","snapshot_observed_at":"2026-08-13T18:31:52.318837Z","submitted_at":"2024-04-02T19:28:11Z","title":"Mixture-of-Depths: Dynamically allocating compute in transformer-based language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02258","snapshot_observed_at":"2026-08-06T16:49:59.760100Z","title":"Mixture-of-depths: Dynamically allocating compute in transformer-based language models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:59.760100Z"},"links":{"cited_paper":"/paper/2404.02258","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:74d1cff4cb146f1882b4c76249bf1ef6d1f29b0bb7859387cadd5b954750c87a","observation_id":"fc70db5e-76e7-4e1b-af06-22a874c99c41","resolution":{"observed_at":"2026-08-06T16:49:59.760100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-12T22:28:12.899379Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-06T16:49:59.827141Z","title":"Aria: An open multimodal native mixture-of- experts model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:59.827141Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:3ac144971e6a694262dfea8d2bf72ffc27cb1bd2c7823ff32fd095ec7bad4111","observation_id":"5512c647-879c-48fd-b611-5cd6e6d1ced4","resolution":{"observed_at":"2026-08-06T16:49:59.827141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:59.936912Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:59.936912Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:1916ca92a7e32a2f5acc8516c36a1487dece411afc39301accb5131c5cc467a9","observation_id":"855a26ff-2ca3-4c63-a529-07a4d654281f","resolution":{"observed_at":"2026-08-06T16:49:59.936912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:00.080685Z","title":"Root mean square layer normalization,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:00.080685Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:d1e5aaf6720f6ac3c489d7c88191e8118731b79c371fcd7e878293a3727b7805","observation_id":"eb7f29c9-3b3a-430d-98aa-32245d0eae88","resolution":{"observed_at":"2026-08-06T16:50:00.080685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:00.195147Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:00.195147Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:9bb97b9105f0e56f4d81c8ecc430adf15d3bdb1f5f9d7c2f2a27ae6ff74cac37","observation_id":"3cec4baf-2c06-4943-b6c5-51583007169e","resolution":{"observed_at":"2026-08-06T16:50:00.195147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:00.302668Z","title":"Coyo-700m: Image-text pair dataset,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:00.302668Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:0be3c1504789ee59971eb3cf05f6856f723e654dbbb8fe487ac34bd95d2eb8ed","observation_id":"7cdd1300-3cee-46af-9e71-46005c45e6b0","resolution":{"observed_at":"2026-08-06T16:50:00.302668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-08-08T05:14:59.435033Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-06T16:50:00.388194Z","title":"Segment anything,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:00.388194Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:9839d4e79269f4dc21d6a5ee6e329105ecccf95557838857d5efd47f7de3c35b","observation_id":"55bf65fe-a0b4-424d-a3f3-aa0da6d66bbf","resolution":{"observed_at":"2026-08-06T16:50:00.388194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-08-12T12:24:23.815073Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-06T16:50:00.517198Z","title":"Kosmos-2: Grounding multimodal large language models to the world,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:00.517198Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:dcc9dbb663f2f67c9c7fccaefe40e82e2c8b8884a61774957c18796e896d9052","observation_id":"b8d07cf3-fba4-4f8d-9360-55cb2ec9d4a8","resolution":{"observed_at":"2026-08-06T16:50:00.517198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-06T16:50:00.619189Z","title":"Microsoft coco captions: Data collection and evaluation server,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:00.619189Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:85f179e2d8acd84f8fb0354e58500fba668cb4146b04a5e8a835a60dc4207107","observation_id":"ffe36186-4645-44ad-8511-f3eb6f815ab9","resolution":{"observed_at":"2026-08-06T16:50:00.619189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:00.734000Z","title":"Textcaps: A dataset for image captioning with reading comprehension,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:00.734000Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:69e783ac508901f8600cccf867a651002a52899260739c8efaa7b95a2ad14121","observation_id":"712be2aa-2719-4a1b-b345-2678d7220474","resolution":{"observed_at":"2026-08-06T16:50:00.734000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:00.805492Z","title":"Objects365: A large-scale, high-quality dataset for object detection,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:00.805492Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:9945388fc9006a785b7a89d1d348b689058c3283ca93cd96d507940f0ef8f745","observation_id":"86908a5d-546f-45a5-9e28-ddc473bd2a39","resolution":{"observed_at":"2026-08-06T16:50:00.805492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:00.874286Z","title":"The all-seeing project: Towards panoptic visual recognition and understanding of the open world,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:00.874286Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:0c45bdb946f573e6d6c2e1073e43aa86018acff9ec2611b36e34935dd9d0c27c","observation_id":"776abb4f-f5de-465b-9e53-745ae1e26aa0","resolution":{"observed_at":"2026-08-06T16:50:00.874286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:00.947847Z","title":"Wukong: A 100 million large-scale chinese cross-modal pre-training benchmark,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:00.947847Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:a6f8041612e1086e3638820f733f64d6deb9c260d6880fb42954d95de8a48866","observation_id":"ba30b0f4-3e61-476c-b798-e2e44d305b27","resolution":{"observed_at":"2026-08-06T16:50:00.947847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:01.031594Z","title":"Laion coco: 600m synthetic captions from laion2b-en","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:01.031594Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:c558b5ae36ea4f110940d641ae75c4c412c801a2e9c24dd82c9f603ec10fc18e","observation_id":"a0b97b9e-f3a1-473d-bb14-7c57e43644a3","resolution":{"observed_at":"2026-08-06T16:50:01.031594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10774","last_updated":"2024-04-15T15:48:48Z","snapshot_observed_at":"2026-08-13T05:24:19.604847Z","submitted_at":"2023-11-15T23:36:42Z","title":"MMC: Advancing Multimodal Chart Understanding with Large-scale Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10774","snapshot_observed_at":"2026-08-06T16:50:01.162563Z","title":"Mmc: Advancing multimodal chart understanding with large- scale instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:01.162563Z"},"links":{"cited_paper":"/paper/2311.10774","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:dee6a4f3828ae8c15f80b0cc9291494e3be85edb334a445e8ea12c1efc63b59a","observation_id":"4ea5e301-bf72-41f3-ab76-9789c6925236","resolution":{"observed_at":"2026-08-06T16:50:01.162563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:01.240559Z","title":"Icdar 2019 competition on large-scale street view text with partial labeling-rrc-lsvt,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:01.240559Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:c847d1de49122341bf68eda4f75171e042f29bee9b2a33ea3dffbc36a7943959","observation_id":"d2e3ed08-d8f3-43f3-a7ca-f6d5c4d79193","resolution":{"observed_at":"2026-08-06T16:50:01.240559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:01.315416Z","title":"Scene text visual question answering,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:01.315416Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:fb44017743314ba3c36ba81e0abe67e0514cd863bcb5e600ff2d1d72aa6970e9","observation_id":"4912a34c-18da-4fa0-97a8-d82f53569c69","resolution":{"observed_at":"2026-08-06T16:50:01.315416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:01.390445Z","title":"Icdar2017 competition on reading chinese text in the wild (rctw-17),","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:01.390445Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:47a4c2ae5d3bcfb9daaf9aebad627a25b173413fd1bab5ef0c46890a02ce869a","observation_id":"c7493250-004c-4ba9-b345-df73855b3bcb","resolution":{"observed_at":"2026-08-06T16:50:01.390445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:01.495683Z","title":"Icdar 2019 robust reading challenge on reading chinese text on signboard,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:01.495683Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:93848b851c4c245eba105d2f0ff5d183b131bd9909c821316e3f28527d3e1fe3","observation_id":"66f3aa88-0aee-4f2e-bd2b-d4dffbf4ddec","resolution":{"observed_at":"2026-08-06T16:50:01.495683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:01.578838Z","title":"Icdar2019 robust reading challenge on arbitrary- shaped text-rrc-art,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:01.578838Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:22ee76ac1be4d18223db71493daa15f389f3e2df350dcc7e53cc79945265c492","observation_id":"b330ee7f-0072-4b50-895e-b9ee0691b6ea","resolution":{"observed_at":"2026-08-06T16:50:01.578838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:01.712181Z","title":"Ocr-free document understanding transformer,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:01.712181Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:e17bcb3daf606b7567451bcf328fc8ccfee91ba4b24a99f0c0f88c3b7843d7e1","observation_id":"3756c26d-5fd7-4b25-929a-db601c9dbe4f","resolution":{"observed_at":"2026-08-06T16:50:01.712181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1601.07140","last_updated":"2016-06-19T23:52:14Z","snapshot_observed_at":"2026-08-14T22:13:00.450823Z","submitted_at":"2016-01-26T19:30:34Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1601.07140","snapshot_observed_at":"2026-08-06T16:50:01.817911Z","title":"Coco-text: Dataset and benchmark for text detection and recognition in natural images,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:01.817911Z"},"links":{"cited_paper":"/paper/1601.07140","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:19cdf7511e6967d58820fa2b45783634ccc3d7d773da412f0e80311b1b69e047","observation_id":"0ec19cce-6c0a-4f41-be1e-fd52bd161f61","resolution":{"observed_at":"2026-08-06T16:50:01.817911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:01.924520Z","title":"Chartqa: A benchmark for question answering about charts with visual and logical reasoning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:01.924520Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:b82148066f1f238cc025840e77b27d20805aa323ac99a2408e539177ad248bba","observation_id":"7c8d6861-01c7-4da6-9a3c-1890fc2068bc","resolution":{"observed_at":"2026-08-06T16:50:01.924520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:02.002148Z","title":"A large chinese text dataset in the wild,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:02.002148Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:ace70f5e5b070bebba0725e290de9b9628b632bc31bf38f20793d29f67c7dceb","observation_id":"61e6366c-974c-407f-8fcb-4b8263ade4fe","resolution":{"observed_at":"2026-08-06T16:50:02.002148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:02.099560Z","title":"Simple and effective multi-paragraph reading comprehension,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:02.099560Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:94acaca4268ae6bb84707806c8337e8965976fbe2553d0cb03ac727aa34bd098","observation_id":"d043d554-ecdf-429c-88da-cf42cc6088d7","resolution":{"observed_at":"2026-08-06T16:50:02.099560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:02.203648Z","title":"Textocr: Towards large-scale end-to-end reasoning for arbitrary-shaped scene text,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:02.203648Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:dc78f3ee3c140a227f3e3eeb1ed9f05569ddfef4dc747646ec34fcf4df54a8ba","observation_id":"0b0c7140-c968-45e5-a601-f6060c883f63","resolution":{"observed_at":"2026-08-06T16:50:02.203648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:02.320729Z","title":"Plotqa: Reasoning over scientific plots,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:02.320729Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:6542ac62536ad35bbe4851096c8fdc7c14db7d8678b354b035493ff665cec775","observation_id":"07cde5a0-af22-42d9-a8cd-9c43ab5f7c76","resolution":{"observed_at":"2026-08-06T16:50:02.320729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:02.423626Z","title":"Infographicvqa,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:02.423626Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:606175de4a9d39531ecb825d71bbc2d1d8dd6b44702d5bb31440318e1280161e","observation_id":"c83be487-e7ae-427b-bf7a-9f520ec9f738","resolution":{"observed_at":"2026-08-06T16:50:02.423626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:02.536884Z","title":"Making the V in VQA matter: Elevating the role of image understanding in visual question answering,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:02.536884Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:05997e66ab6758f3f9bbd5d0214f904f79a37e96e2a8d68f4b49871d32974c62","observation_id":"66675f87-dc47-41fa-b6ab-4ab661215fed","resolution":{"observed_at":"2026-08-06T16:50:02.536884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:02.641238Z","title":"GQA: A new dataset for real-world visual reasoning and compositional question answering,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:02.641238Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:6293890b32b4d3c960dbed98810aa158f7fb0d289ea0939e5de5a27f17ee433d","observation_id":"546425af-4490-472f-8619-4c156080f53f","resolution":{"observed_at":"2026-08-06T16:50:02.641238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:02.746998Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:02.746998Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:aae417bbca62713c37a54e3a382ce96f5ea62c4c0000f01510ac6c37755d10ab","observation_id":"f900c643-6726-47c9-aa9f-549eb9f80e8f","resolution":{"observed_at":"2026-08-06T16:50:02.746998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:02.852857Z","title":"Visual spatial reasoning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:02.852857Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:d70e5a90b5cc3d6b8bd48558b17aef5ca1430d4152db21644e50049ffe46f6ec","observation_id":"2bc39bd7-4222-4de2-9972-5cd6c418f854","resolution":{"observed_at":"2026-08-06T16:50:02.852857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:02.963424Z","title":"Visual dialog,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:02.963424Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:14b1aa67a05933bbdcd8d247b52d504a2ce800364ee0c45ec95c18ecfd989442","observation_id":"d9264504-9076-436e-8b1e-bc1716e767a3","resolution":{"observed_at":"2026-08-06T16:50:02.963424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:03.027579Z","title":"A diagram is worth a dozen images,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:03.027579Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:93e57a3ab0762a7e89981998306cc04bbd5c836060763c7cb8e2bbd4ac4a0380","observation_id":"eeba70c5-126f-4a87-bc5f-c70595bee6fd","resolution":{"observed_at":"2026-08-06T16:50:03.027579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:03.153797Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:03.153797Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:4494c7c4867d661a0f34a1b09e9e0a7ed59d7dbbc63d8438e31b839beeea008a","observation_id":"c19cef38-137e-4204-beaa-d73fa8976722","resolution":{"observed_at":"2026-08-06T16:50:03.153797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:03.236776Z","title":"Are you smarter than a sixth grader? textbook question answering for multimodal machine comprehension,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:03.236776Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:9f21a989290c14ee2806b0d0724fe1a98fe79d8e7cc78b87a91b11e7bcfb0527","observation_id":"4b270660-b3fa-4df9-b4fd-4cbb7a7e6ffd","resolution":{"observed_at":"2026-08-06T16:50:03.236776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:03.384359Z","title":"Dvqa: Understanding data visualizations via question answering,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:03.384359Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:3a9222187f966ed6d4e0abc9e94d94cd4aae8a124d36a88161a142e6793840d9","observation_id":"28539a3e-357e-43f1-a2e4-1a229e7f10a5","resolution":{"observed_at":"2026-08-06T16:50:03.384359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14565","last_updated":"2024-03-19T22:53:25Z","snapshot_observed_at":"2026-08-15T06:26:48.150151Z","submitted_at":"2023-06-26T10:26:33Z","title":"Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14565","snapshot_observed_at":"2026-08-06T16:50:03.529613Z","title":"Aligning large multi-modal model with robust instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:03.529613Z"},"links":{"cited_paper":"/paper/2306.14565","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:648f579758618cf657b368281069d0b77a87cc01bc0accea040166cf42ebec71","observation_id":"3f8cb091-aeeb-40d2-97cc-477d8c8b0a9f","resolution":{"observed_at":"2026-08-06T16:50:03.529613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:03.654147Z","title":"An augmented benchmark dataset for geometric question answering through dual parallel text encoding,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:03.654147Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:05cf6419b8285a09f948ecc4bfa50458914da2425059d75d57338caecf00f18b","observation_id":"7382f2c5-4d5a-431e-bb17-b95211031b07","resolution":{"observed_at":"2026-08-06T16:50:03.654147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14610","last_updated":"2023-03-02T07:41:55Z","snapshot_observed_at":"2026-08-13T14:17:11.182458Z","submitted_at":"2022-09-29T08:01:04Z","title":"Dynamic Prompt Learning via Policy Gradient for Semi-structured Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14610","snapshot_observed_at":"2026-08-06T16:50:03.783517Z","title":"Dynamic prompt learning via policy gradient for semi- structured mathematical reasoning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:03.783517Z"},"links":{"cited_paper":"/paper/2209.14610","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:ded2c8e4c4b4f901b1af62ea0c81085de5dcdda826e15bca6e500f8a6f1f51ce","observation_id":"f8b413f7-7d5a-45e3-8655-2a7e0c828785","resolution":{"observed_at":"2026-08-06T16:50:03.783517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.12284","last_updated":"2024-05-03T17:36:07Z","snapshot_observed_at":"2026-08-13T10:57:13.012119Z","submitted_at":"2023-09-21T17:45:42Z","title":"MetaMath: Bootstrap Your Own Mathematical Questions for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.12284","snapshot_observed_at":"2026-08-06T16:50:03.926291Z","title":"Metamath: Bootstrap your own mathematical questions for large language models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:03.926291Z"},"links":{"cited_paper":"/paper/2309.12284","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:ce8e33702fa699036a7fcbbe54b6a70660ac1fc5dd490e95c5bf8d298efa933c","observation_id":"33c867b7-c587-4172-a55b-d3a85925e403","resolution":{"observed_at":"2026-08-06T16:50:03.926291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.05358","last_updated":"2022-08-10T14:08:34Z","snapshot_observed_at":"2026-08-13T14:47:41.575216Z","submitted_at":"2022-08-10T14:08:34Z","title":"CLEVR-Math: A Dataset for Compositional Language, Visual and Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.05358","snapshot_observed_at":"2026-08-06T16:50:04.072385Z","title":"Clevr-math: A dataset for compositional language, visual and mathematical reasoning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:04.072385Z"},"links":{"cited_paper":"/paper/2208.05358","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:c79c4b13fd7982532ebe3a1667f1e5a95b2381eeb493e728e41dd7793a286a25","observation_id":"65f50570-1ed8-4434-a038-0a613d7da31b","resolution":{"observed_at":"2026-08-06T16:50:04.072385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:04.211430Z","title":"Super-clevr: A virtual benchmark to diagnose domain robustness in visual reasoning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:04.211430Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:3a1b8411768c8c5ce33f66914d247a432417b7f7e65adf2ba2cf4a4f638b9159","observation_id":"26aebb84-91f1-4696-a69d-57638124a7e8","resolution":{"observed_at":"2026-08-06T16:50:04.211430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.04165","last_updated":"2021-07-20T23:22:27Z","snapshot_observed_at":"2026-08-06T13:29:31.050456Z","submitted_at":"2021-05-10T07:46:55Z","title":"Inter-GPS: Interpretable Geometry Problem Solving with Formal Language and Symbolic Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.04165","snapshot_observed_at":"2026-08-06T16:50:04.330336Z","title":"Inter-gps: Interpretable geometry problem solving with formal language and symbolic reasoning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:04.330336Z"},"links":{"cited_paper":"/paper/2105.04165","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:2f0008c21ae003ea4eb3e96b5d857af29456b747b8436aa1a194a78b1aa5068b","observation_id":"3eaa7f89-402a-4e8d-bff3-c1d1320a9647","resolution":{"observed_at":"2026-08-06T16:50:04.330336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:04.443260Z","title":"Kvqa: Knowledge- aware visual question answering,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:04.443260Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:b8d56ce2ec5c946a33b296e3a32104f4f85d0298bd117e384346bc74a3d17a71","observation_id":"9408ddf6-13f9-46d8-9640-f0bca390a041","resolution":{"observed_at":"2026-08-06T16:50:04.443260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:04.560616Z","title":"A-okvqa: A benchmark for visual question answering using world knowledge,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:04.560616Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:3deff4470ea432fe3bdec3fb46c5f260f7c675749f52dc1a95384e3f0eb8ff7b","observation_id":"e2063723-1016-463b-a2ca-3d5ac2691921","resolution":{"observed_at":"2026-08-06T16:50:04.560616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:04.660448Z","title":"Viquae, a dataset for knowledge- based visual question answering about named entities,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:04.660448Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:8b8e5551c21da231eeaa7fc6eef29311f80e220b5b7a478133027a79c892d6f5","observation_id":"197b7174-653d-4cb5-9496-32b7ee46a3a6","resolution":{"observed_at":"2026-08-06T16:50:04.660448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10755","last_updated":"2023-09-15T09:52:14Z","snapshot_observed_at":"2026-08-13T10:30:24.801415Z","submitted_at":"2023-08-21T14:40:48Z","title":"WanJuan: A Comprehensive Multimodal Dataset for Advancing English and Chinese Large Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.10755","snapshot_observed_at":"2026-08-06T16:50:04.722409Z","title":"Wanjuan: A comprehensive multimodal dataset for advancing english and chinese large models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:04.722409Z"},"links":{"cited_paper":"/paper/2308.10755","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:0313257a31d7797752aa385bdd857fa72fbdeebf1b5c42005bb33faa2c05bb1d","observation_id":"3d17bb68-d896-410f-921f-b62d7d2c94aa","resolution":{"observed_at":"2026-08-06T16:50:04.722409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:04.785021Z","title":"Ocr-vqa: Visual question answering by reading text in images,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:04.785021Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:0534036abf22157117aa5802271ef6502972116e749b989c45802bf1b43a26db","observation_id":"7cb3cda1-178f-4ead-a61f-9f8600364ab3","resolution":{"observed_at":"2026-08-06T16:50:04.785021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:04.861787Z","title":"Towards VQA models that can read,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:04.861787Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:f7f41a25b4df9906c17673274df3df14cf655ce5d54d3604726987cfce6a2201","observation_id":"b50417c2-8ed8-42df-b13a-983ad4fd2128","resolution":{"observed_at":"2026-08-06T16:50:04.861787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:04.943013Z","title":"Modeling context in referring expressions,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:04.943013Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:8303f384ba467a181fce000c8d6d7bce890fca1ee8be072ff1f46d443b31d876","observation_id":"581d54b1-e307-452a-bfe9-6335283eaa70","resolution":{"observed_at":"2026-08-06T16:50:04.943013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:05.027353Z","title":"Generation and comprehension of unambiguous object descriptions,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:05.027353Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:daf269485dac1ba432019275107fe15afe4896c13bfcb4340594b3cc35cd4f1c","observation_id":"8f850fd4-aafe-4cb7-9acd-c1616efcf848","resolution":{"observed_at":"2026-08-06T16:50:05.027353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:05.105073Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:05.105073Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:d11f2e0c0d63b36734cdbb07e08d43d751579cba1b963488b9490b95059bd0c7","observation_id":"ed4402f5-07e4-43c4-bc10-7c2124596bd3","resolution":{"observed_at":"2026-08-06T16:50:05.105073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07574","last_updated":"2023-11-29T15:37:24Z","snapshot_observed_at":"2026-08-15T03:50:59.768240Z","submitted_at":"2023-11-13T18:59:31Z","title":"To See is to Believe: Prompting GPT-4V for Better Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07574","snapshot_observed_at":"2026-08-06T16:50:05.174737Z","title":"To see is to believe: Prompting gpt-4v for better visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:05.174737Z"},"links":{"cited_paper":"/paper/2311.07574","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:88f8d280231118c0546828c0a40bf38aba97aa0743c4f0097318a47d771b503b","observation_id":"b970ecbc-9311-4a1b-bd3c-f83feadd74b4","resolution":{"observed_at":"2026-08-06T16:50:05.174737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-08-06T16:50:05.268162Z","title":"Allava: Harnessing gpt4v-synthesized data for a lite vision-language model,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:05.268162Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:61ff620d723447c25d137d8520d30e5eed78928541c0e434185ab4a3af79b894","observation_id":"244696a9-e355-4869-9b6a-18fa1cf73075","resolution":{"observed_at":"2026-08-06T16:50:05.268162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:05.335533Z","title":"Gpt-4v dataset,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:05.335533Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:d531c0e83aaa4a5d5d323ff047088ea2e3f4f2031a29f7d8a47ce7c482b548fc","observation_id":"65664252-de60-4c8d-b58a-736bf1bdcfb6","resolution":{"observed_at":"2026-08-06T16:50:05.335533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:05.406294Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:05.406294Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:d795331c0652c6810fe858cccab12ebb9b6702a5991d925cf0dfdcd675ba0243","observation_id":"6d38fdb5-0f7b-4210-b379-69b149ae4558","resolution":{"observed_at":"2026-08-06T16:50:05.406294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04087","last_updated":"2023-12-28T16:01:36Z","snapshot_observed_at":"2026-08-15T07:56:22.716749Z","submitted_at":"2023-07-09T03:25:14Z","title":"SVIT: Scaling up Visual Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04087","snapshot_observed_at":"2026-08-06T16:50:05.494156Z","title":"SVIT: scaling up visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:05.494156Z"},"links":{"cited_paper":"/paper/2307.04087","citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:440cb408b322bd60f340b236d33ba25b67358ddccbab98d7f32b2bad4cdde361","observation_id":"d86c7702-3db9-44f1-ab53-65377a19e076","resolution":{"observed_at":"2026-08-06T16:50:05.494156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:50:05.568237Z","title":"Openhermes 2.5: An open dataset of synthetic data for generalist llm assistants,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-06T16:50:05.568237Z"},"links":{"citing_paper":"/paper/2507.12566"},"observation_digest":"sha256:e81d2978f94dbfba74e4b2a9c5bd6218ad82f94c3c66200aa4681835ed2450f5","observation_id":"24e6065c-6e91-4ccd-ade8-cada6d4633bf","resolution":{"observed_at":"2026-08-06T16:50:05.568237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.12566","last_updated":"2025-07-16T18:31:23Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T14:21:45.537414Z","submitted_at":"2025-07-16T18:31:23Z","title":"Mono-InternVL-1.5: Towards Cheaper and Faster Monolithic Multimodal Large Language Models"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":98,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":137},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 100 of 137 outbound references and 2 inbound Pith citation observations for arXiv:2507.12566."}