{"as_of":"2026-08-14T12:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6344ed9bd39c2d2e8a6ee910a07af79c1de4b9488df4f934d65f009c7adf88ff","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:53:05.141147Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.21596/citation-record","integrity":"/paper/2506.21596/integrity","json":"/paper/2506.21596/citation-record.json","paper":"/paper/2506.21596"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:03.563420Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21596","last_updated":"2025-07-15T09:14:31Z","snapshot_observed_at":"2026-08-12T13:30:30.609327Z","submitted_at":"2025-06-18T19:31:35Z","title":"Evaluating Multimodal Large Language Models on Educational Textbook Question Answering","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:03.563420Z"},"links":{"citing_paper":"/paper/2506.21596"},"observation_digest":"sha256:0bad04aa5324ae57fcb0f08ec0fdb7700482548f0030423c4edcbc9d62a10d95","observation_id":"fae8a539-5ada-4a15-8b65-ee2a7d11eaa7","resolution":{"observed_at":"2026-08-06T23:53:03.563420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-08-13T06:40:28.574929Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-06T23:53:03.623288Z","title":"Improved baselines with visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21596","last_updated":"2025-07-15T09:14:31Z","snapshot_observed_at":"2026-08-12T13:30:30.609327Z","submitted_at":"2025-06-18T19:31:35Z","title":"Evaluating Multimodal Large Language Models on Educational Textbook Question Answering","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:03.623288Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2506.21596"},"observation_digest":"sha256:d5d8cf3c312b21fbb6adcd34ae3fce20d836a416dbe6d324b7d85766ceec78d9","observation_id":"00f0d1c9-a049-4ace-ba4c-bde3bd43e63d","resolution":{"observed_at":"2026-08-06T23:53:03.623288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T23:53:03.679170Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21596","last_updated":"2025-07-15T09:14:31Z","snapshot_observed_at":"2026-08-12T13:30:30.609327Z","submitted_at":"2025-06-18T19:31:35Z","title":"Evaluating Multimodal Large Language Models on Educational Textbook Question Answering","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:03.679170Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.21596"},"observation_digest":"sha256:bc864846d9254c5712b4ca6a975f3721b46e3059db34b788c0cce25d917c1643","observation_id":"4d946e54-d937-4ff2-b146-3688b3a99d89","resolution":{"observed_at":"2026-08-06T23:53:03.679170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:08.982277Z","title":"Taking the next step with generative artificial intelligence: The transformative role of multimodal large language models in science education,","venue":null,"work_id":"433abe08-5603-4ecb-8c24-0c665d79f8ff","year":2025},"citing_paper":{"arxiv_id":"2506.21596","last_updated":"2025-07-15T09:14:31Z","snapshot_observed_at":"2026-08-12T13:30:30.609327Z","submitted_at":"2025-06-18T19:31:35Z","title":"Evaluating Multimodal Large Language Models on Educational Textbook Question Answering","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:03.747155Z"},"links":{"citing_paper":"/paper/2506.21596"},"observation_digest":"sha256:d2b3ce797b81cb053ae65ec9f96985d92806f1f196c443b4ebf616d7bdc3c81c","observation_id":"7bd79d0f-16e8-494e-a535-8c84e774f444","resolution":{"observed_at":"2026-08-06T23:53:09.040655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:08.821487Z","title":"On opportunities and challenges of large multimodal foundation models in education,","venue":null,"work_id":"aef3ec17-13eb-4988-8c84-e8a94cc202f5","year":2025},"citing_paper":{"arxiv_id":"2506.21596","last_updated":"2025-07-15T09:14:31Z","snapshot_observed_at":"2026-08-12T13:30:30.609327Z","submitted_at":"2025-06-18T19:31:35Z","title":"Evaluating Multimodal Large Language Models on Educational Textbook Question Answering","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:03.838513Z"},"links":{"citing_paper":"/paper/2506.21596"},"observation_digest":"sha256:2835bb91da9c5d8e36f014fd70ccc4b31f2a9cb0d8b58c547c27a8b574e917ef","observation_id":"7ce0486e-a7fe-4841-9a56-18d74747f6c9","resolution":{"observed_at":"2026-08-06T23:53:08.905573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:08.712019Z","title":"Are you smarter than a sixth grader? textbook question an- swering for multimodal machine comprehension,","venue":null,"work_id":"c43908d3-56af-43b7-97ca-cbeb18f92f5f","year":2017},"citing_paper":{"arxiv_id":"2506.21596","last_updated":"2025-07-15T09:14:31Z","snapshot_observed_at":"2026-08-12T13:30:30.609327Z","submitted_at":"2025-06-18T19:31:35Z","title":"Evaluating Multimodal Large Language Models on Educational Textbook Question Answering","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:03.910260Z"},"links":{"citing_paper":"/paper/2506.21596"},"observation_digest":"sha256:0a2b69c30e7671fb3c5790c96f5284084e7343390f46f6e3f6bf4c59f48722a6","observation_id":"84789112-6207-439f-af96-0dcb1a5516bb","resolution":{"observed_at":"2026-08-06T23:53:08.772329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:08.542503Z","title":"A review on vision-language-based approaches: Challenges and applications,","venue":null,"work_id":"e771f4bb-19fa-425c-99de-cad285ea7f9e","year":2025},"citing_paper":{"arxiv_id":"2506.21596","last_updated":"2025-07-15T09:14:31Z","snapshot_observed_at":"2026-08-12T13:30:30.609327Z","submitted_at":"2025-06-18T19:31:35Z","title":"Evaluating Multimodal Large Language Models on Educational Textbook Question Answering","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:03.979107Z"},"links":{"citing_paper":"/paper/2506.21596"},"observation_digest":"sha256:a38199e66e9012d6c279ff3cd0fa839ef3d3b9aa9549ac7bc268eb12250d6c4b","observation_id":"151a1e35-aeab-43f6-92c5-1e26822f2f62","resolution":{"observed_at":"2026-08-06T23:53:08.624559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:08.413151Z","title":"Blip-2: Bootstrapping language- image pre-training with frozen image encoders and large language models,","venue":null,"work_id":"ac1d1807-8dd3-467e-8b7e-edd6c7dc1abf","year":2023},"citing_paper":{"arxiv_id":"2506.21596","last_updated":"2025-07-15T09:14:31Z","snapshot_observed_at":"2026-08-12T13:30:30.609327Z","submitted_at":"2025-06-18T19:31:35Z","title":"Evaluating Multimodal Large Language Models on Educational Textbook Question Answering","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:04.026641Z"},"links":{"citing_paper":"/paper/2506.21596"},"observation_digest":"sha256:1fcd2dbd96f49ec2ad8d31e1a292f0b56c41cb2f145c8c9f2eca629b72a36b18","observation_id":"c3a08743-84a5-47c9-9a33-7446f9f640aa","resolution":{"observed_at":"2026-08-06T23:53:08.480404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:08.252986Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models,","venue":null,"work_id":"67e2a040-6181-43c3-b257-5b8efe502fe1","year":2024},"citing_paper":{"arxiv_id":"2506.21596","last_updated":"2025-07-15T09:14:31Z","snapshot_observed_at":"2026-08-12T13:30:30.609327Z","submitted_at":"2025-06-18T19:31:35Z","title":"Evaluating Multimodal Large Language Models on Educational Textbook Question Answering","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:04.086129Z"},"links":{"citing_paper":"/paper/2506.21596"},"observation_digest":"sha256:8d1db267cb1cf6a241de2a33e8a97f0f63c9cd24820f86ed911c498b79ed534d","observation_id":"f5eeea5c-cbeb-44a8-ae56-fd4e724b9905","resolution":{"observed_at":"2026-08-06T23:53:08.330726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:08.078871Z","title":"Making the v in VQA matter: Elevating the role of image understanding in visual question answering,","venue":null,"work_id":"55b98bd3-385e-4e01-aaf5-39ff22cc93e8","year":2017},"citing_paper":{"arxiv_id":"2506.21596","last_updated":"2025-07-15T09:14:31Z","snapshot_observed_at":"2026-08-12T13:30:30.609327Z","submitted_at":"2025-06-18T19:31:35Z","title":"Evaluating Multimodal Large Language Models on Educational Textbook Question Answering","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:04.143669Z"},"links":{"citing_paper":"/paper/2506.21596"},"observation_digest":"sha256:abde2622669ed5741bf0c6f54acbfd25bad169f62632e8292c2909af07b8de9c","observation_id":"27591440-ac1b-49a3-ab2e-1d280f14405a","resolution":{"observed_at":"2026-08-06T23:53:08.189944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:07.864761Z","title":"Ok-VQA: A visual question answering benchmark requiring external knowledge,","venue":null,"work_id":"4d632718-ce41-4aa5-8021-c796ed3f7f1c","year":2019},"citing_paper":{"arxiv_id":"2506.21596","last_updated":"2025-07-15T09:14:31Z","snapshot_observed_at":"2026-08-12T13:30:30.609327Z","submitted_at":"2025-06-18T19:31:35Z","title":"Evaluating Multimodal Large Language Models on Educational Textbook Question Answering","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:04.184296Z"},"links":{"citing_paper":"/paper/2506.21596"},"observation_digest":"sha256:ef011b25bb5ca090f52d108a40c1158a355e17e356692d8c967a6ade96de73b9","observation_id":"8849f29d-7b38-406b-bb3d-46f2ce5e6da2","resolution":{"observed_at":"2026-08-06T23:53:08.013450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:07.552812Z","title":"Microsoft COCO: Common objects in context,","venue":null,"work_id":"0bf13cde-d791-46a7-85c6-e8a0cfd3ecf1","year":2014},"citing_paper":{"arxiv_id":"2506.21596","last_updated":"2025-07-15T09:14:31Z","snapshot_observed_at":"2026-08-12T13:30:30.609327Z","submitted_at":"2025-06-18T19:31:35Z","title":"Evaluating Multimodal Large Language Models on Educational Textbook Question Answering","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:04.276954Z"},"links":{"citing_paper":"/paper/2506.21596"},"observation_digest":"sha256:c5c33ac23856a646376527b54fa0a6075a11ee24d4ad7caed8fc855ca1201460","observation_id":"d620872c-86af-4ed9-9521-eeafac3d6cac","resolution":{"observed_at":"2026-08-06T23:53:07.691252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.09413","last_updated":"2025-01-10T19:41:43Z","snapshot_observed_at":"2026-08-14T03:13:59.771276Z","submitted_at":"2024-07-12T16:37:59Z","title":"SPIQA: A Dataset for Multimodal Question Answering on Scientific Papers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.09413","snapshot_observed_at":"2026-08-06T23:53:04.357027Z","title":"SPIQA: A dataset for multimodal question answering on scientific papers,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21596","last_updated":"2025-07-15T09:14:31Z","snapshot_observed_at":"2026-08-12T13:30:30.609327Z","submitted_at":"2025-06-18T19:31:35Z","title":"Evaluating Multimodal Large Language Models on Educational Textbook Question Answering","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:04.357027Z"},"links":{"cited_paper":"/paper/2407.09413","citing_paper":"/paper/2506.21596"},"observation_digest":"sha256:3eab81c5451d35faf65105a5a18165f65c750810f15d26738910a596074d28fd","observation_id":"f6143b45-6167-4c8f-ac0a-421e7d3d17e2","resolution":{"observed_at":"2026-08-06T23:53:04.357027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:07.318376Z","title":"Eduvqa: A multimodal visual question answering framework for smart education,","venue":null,"work_id":"6bf22538-2b9e-45e1-89cf-c2eccffe2946","year":2025},"citing_paper":{"arxiv_id":"2506.21596","last_updated":"2025-07-15T09:14:31Z","snapshot_observed_at":"2026-08-12T13:30:30.609327Z","submitted_at":"2025-06-18T19:31:35Z","title":"Evaluating Multimodal Large Language Models on Educational Textbook Question Answering","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:04.425031Z"},"links":{"citing_paper":"/paper/2506.21596"},"observation_digest":"sha256:a65b2379ec34c75d87032ccba3b04a261eaed2e713c74bcf7243084ddbafeebe","observation_id":"0ea08724-8e05-4920-9e19-52d5ca82ee55","resolution":{"observed_at":"2026-08-06T23:53:07.417384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:07.030373Z","title":"Enhancing textual textbook question answering with large language models and retrieval augmented generation,","venue":null,"work_id":"8123ecac-1654-434a-ad18-6b6f29badea9","year":2025},"citing_paper":{"arxiv_id":"2506.21596","last_updated":"2025-07-15T09:14:31Z","snapshot_observed_at":"2026-08-12T13:30:30.609327Z","submitted_at":"2025-06-18T19:31:35Z","title":"Evaluating Multimodal Large Language Models on Educational Textbook Question Answering","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:04.508308Z"},"links":{"citing_paper":"/paper/2506.21596"},"observation_digest":"sha256:1a1e35d23467279bce3fe81261132363a42913164cdc6a0e1e56a733f4a3cc36","observation_id":"d54e57bf-b35c-4e3e-a1f2-94a3233472c4","resolution":{"observed_at":"2026-08-06T23:53:07.151392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:06.784446Z","title":"Enhancing textbook question answering with knowledge graph-augmented large language models,","venue":null,"work_id":"2f06d6f4-afe0-4ef0-aa0f-4a9f1e17e83e","year":2024},"citing_paper":{"arxiv_id":"2506.21596","last_updated":"2025-07-15T09:14:31Z","snapshot_observed_at":"2026-08-12T13:30:30.609327Z","submitted_at":"2025-06-18T19:31:35Z","title":"Evaluating Multimodal Large Language Models on Educational Textbook Question Answering","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:04.614008Z"},"links":{"citing_paper":"/paper/2506.21596"},"observation_digest":"sha256:a6d1da5f1870fccfe83ba0ff6d1f263dea1754b567eaa8fa184d1157275cbaaa","observation_id":"57cf384d-eed3-4364-b65d-c3f0844c66a5","resolution":{"observed_at":"2026-08-06T23:53:06.928385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:06.507952Z","title":"ISAAQ - mastering textbook questions with pre-trained transformers and bottom-up and top-down attention,","venue":null,"work_id":"792d7e63-0529-436b-b176-9b550ff189da","year":2020},"citing_paper":{"arxiv_id":"2506.21596","last_updated":"2025-07-15T09:14:31Z","snapshot_observed_at":"2026-08-12T13:30:30.609327Z","submitted_at":"2025-06-18T19:31:35Z","title":"Evaluating Multimodal Large Language Models on Educational Textbook Question Answering","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:04.676803Z"},"links":{"citing_paper":"/paper/2506.21596"},"observation_digest":"sha256:a23a0990dfb32900b0157e91938f3d0f33cfc6146b97284f6230cc657a1020d4","observation_id":"f75ebdc2-61c3-4db1-8337-07a1e4745380","resolution":{"observed_at":"2026-08-06T23:53:06.642236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:06.233059Z","title":"Imagebind: One embedding space to bind them all,","venue":null,"work_id":"29507ea6-4fc2-421d-a445-41085500d814","year":2023},"citing_paper":{"arxiv_id":"2506.21596","last_updated":"2025-07-15T09:14:31Z","snapshot_observed_at":"2026-08-12T13:30:30.609327Z","submitted_at":"2025-06-18T19:31:35Z","title":"Evaluating Multimodal Large Language Models on Educational Textbook Question Answering","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:04.754929Z"},"links":{"citing_paper":"/paper/2506.21596"},"observation_digest":"sha256:7f6ffa86380bcd0ba0a73d7719ee22a4ff9882ba9d4e2c59f4e9e5e112079884","observation_id":"921db7cb-37bc-4d69-abda-1a6b2cb389f5","resolution":{"observed_at":"2026-08-06T23:53:06.355230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:05.963894Z","title":"KDB.AI: The scalable vector database for ai,","venue":null,"work_id":"e519f45a-2bd1-4cd2-9894-26d3fcb7b479","year":2023},"citing_paper":{"arxiv_id":"2506.21596","last_updated":"2025-07-15T09:14:31Z","snapshot_observed_at":"2026-08-12T13:30:30.609327Z","submitted_at":"2025-06-18T19:31:35Z","title":"Evaluating Multimodal Large Language Models on Educational Textbook Question Answering","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:04.846424Z"},"links":{"citing_paper":"/paper/2506.21596"},"observation_digest":"sha256:688016634a4df3af3d3d63683bb86c76bfd3deef9a86d0083cbe02c6a00b6003","observation_id":"44b78eb2-0f23-4782-ab3a-a9a17102ef91","resolution":{"observed_at":"2026-08-06T23:53:06.116786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:05.673580Z","title":"GPT-4v(ision) system card,","venue":null,"work_id":"a77cf498-c9c7-402c-8d23-06cad93f9974","year":2023},"citing_paper":{"arxiv_id":"2506.21596","last_updated":"2025-07-15T09:14:31Z","snapshot_observed_at":"2026-08-12T13:30:30.609327Z","submitted_at":"2025-06-18T19:31:35Z","title":"Evaluating Multimodal Large Language Models on Educational Textbook Question Answering","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:04.897266Z"},"links":{"citing_paper":"/paper/2506.21596"},"observation_digest":"sha256:ec11aa262d24a56ab3de454b22cc1ed1df360aed4fa9accdf77fde54abb9427f","observation_id":"0c0e506f-a6b0-4bfb-a07f-4847e7c6b754","resolution":{"observed_at":"2026-08-06T23:53:05.828269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T23:53:04.903476Z","title":"Gemini: A family of highly capable multimodal models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21596","last_updated":"2025-07-15T09:14:31Z","snapshot_observed_at":"2026-08-12T13:30:30.609327Z","submitted_at":"2025-06-18T19:31:35Z","title":"Evaluating Multimodal Large Language Models on Educational Textbook Question Answering","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:04.903476Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.21596"},"observation_digest":"sha256:bb291ecc5dfbdaad4c21193a1316c632391d83725553d7bfd8e72f3f2a731e18","observation_id":"8b00df41-b0d4-4458-a67e-8354fd5278a6","resolution":{"observed_at":"2026-08-06T23:53:04.903476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:05.488014Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"ac10ee82-9d17-4674-b374-fc6e62ab0bb5","year":2021},"citing_paper":{"arxiv_id":"2506.21596","last_updated":"2025-07-15T09:14:31Z","snapshot_observed_at":"2026-08-12T13:30:30.609327Z","submitted_at":"2025-06-18T19:31:35Z","title":"Evaluating Multimodal Large Language Models on Educational Textbook Question Answering","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:04.997136Z"},"links":{"citing_paper":"/paper/2506.21596"},"observation_digest":"sha256:05366d704c8cacfb99fc7fd57ebfdba1a283e0ee13aeb269e59aceb0843933c8","observation_id":"af04fca8-030e-4bf4-95f4-b09c94cea7f5","resolution":{"observed_at":"2026-08-06T23:53:05.582385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:05.310933Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90% chatgpt quality,","venue":null,"work_id":"7d5afb64-8922-4358-819c-379f8b59ead3","year":2023},"citing_paper":{"arxiv_id":"2506.21596","last_updated":"2025-07-15T09:14:31Z","snapshot_observed_at":"2026-08-12T13:30:30.609327Z","submitted_at":"2025-06-18T19:31:35Z","title":"Evaluating Multimodal Large Language Models on Educational Textbook Question Answering","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:05.141147Z"},"links":{"citing_paper":"/paper/2506.21596"},"observation_digest":"sha256:cd96a705295ada5adce8e87ed567f1a239fcbc55ac60bcc74a3310ea078c96de","observation_id":"8e02cfc0-9382-4039-afa1-b29ccdf59431","resolution":{"observed_at":"2026-08-06T23:53:05.393712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.21596","last_updated":"2025-07-15T09:14:31Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-12T13:30:30.609327Z","submitted_at":"2025-06-18T19:31:35Z","title":"Evaluating Multimodal Large Language Models on Educational Textbook Question Answering"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":0,"verified_fuzzy":18},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 0 inbound Pith citation observations for arXiv:2506.21596."}