{"as_of":"2026-08-16T19:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:14211109c0471200383307e06c60ba3a65c87e5e6fb936ade6ffb0f9a5ab904a","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T20:56:42.553926Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":41,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:02:43.013019Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T19:40:07.154168Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-08-11T13:19:23.188483Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.13303","last_updated":"2025-05-15T22:00:19Z","snapshot_observed_at":"2026-08-15T01:32:05.414283Z","submitted_at":"2024-12-17T20:09:55Z","title":"FastVLM: Efficient Vision Encoding for Vision Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T13:19:23.188483Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2412.13303"},"observation_digest":"sha256:aea8a43e30598e252d2755009ce7275cea79bb567d50c1c392f31847efd00acd","observation_id":"37976e9a-38a0-43ba-b502-0c0f2ee8555e","resolution":{"observed_at":"2026-08-11T13:19:23.188483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-08-10T22:08:10.041348Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-14T12:32:34.328935Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"reference_index":294,"source":"pdf_text","source_observed_at":"2026-08-10T22:08:10.041348Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2501.02765"},"observation_digest":"sha256:5b6dd77761331541dccc9db8d9f6229e32a3c1965aa02fa4228971df8e9fbd76","observation_id":"c46585a1-cbc9-40e3-9432-9fe4c0339963","resolution":{"observed_at":"2026-08-10T22:08:10.041348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-08-08T22:47:39.147822Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale.arXiv preprint arXiv:2412.05237,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-14T09:13:56.327308Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.147822Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:bed607506e5b81fce16e3261b7f1a0e78b39e93878bb5797ea5d0b32252b71ec","observation_id":"f02c1b66-f08c-445d-a481-2881b210d20a","resolution":{"observed_at":"2026-08-08T22:47:39.147822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":"2412.05237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-07-04T19:40:07.154168Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":"6b851c4c-d27c-4e39-aadd-a27efd45cfd9","year":2024},"citing_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-23T02:25:04.405036Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2502.13923"},"observation_digest":"sha256:b72472baafaf9b87442e8a40edb69cb18c7026f6f05eb75468febc289ac81f21","observation_id":"b93518cb-dc78-4422-81fb-50abce96ca5d","resolution":{"observed_at":"2026-05-23T02:25:19.077389Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":"2412.05237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-07-04T19:40:07.154168Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":"6b851c4c-d27c-4e39-aadd-a27efd45cfd9","year":2024},"citing_paper":{"arxiv_id":"2503.10615","last_updated":"2025-03-18T08:52:34Z","snapshot_observed_at":"2026-08-15T09:44:57.157415Z","submitted_at":"2025-03-13T17:56:05Z","title":"R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T00:19:20.462455Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2503.10615"},"observation_digest":"sha256:84bda6cc64832714727ccea69faf42763b1f39aa50e6cf8df653e44c53176faf","observation_id":"d37b096c-0952-4d52-aa29-37be6b437a11","resolution":{"observed_at":"2026-05-16T00:19:20.527581Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":"2412.05237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-07-04T19:40:07.154168Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":"6b851c4c-d27c-4e39-aadd-a27efd45cfd9","year":2024},"citing_paper":{"arxiv_id":"2503.12605","last_updated":"2025-03-23T13:47:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-16T18:39:13Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","version":2},"reference_index":256,"source":"pdf_text","source_observed_at":"2026-05-15T17:18:52.996467Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2503.12605"},"observation_digest":"sha256:a0995f54d54073faf0c314c341f3ccfc01c9c2d87433779c8ad29a9ae65c58b1","observation_id":"0ccbae95-297b-469a-988f-6eacb9334bb8","resolution":{"observed_at":"2026-05-15T17:18:53.580628Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":"2412.05237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-07-04T19:40:07.154168Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":"6b851c4c-d27c-4e39-aadd-a27efd45cfd9","year":2024},"citing_paper":{"arxiv_id":"2503.17352","last_updated":"2025-11-11T08:13:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-21T17:52:43Z","title":"OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-19T06:59:03.112252Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2503.17352"},"observation_digest":"sha256:08288bc4c396ef22b54b2c5c6e7fda7d11ce8ec70b8e47dca5f03f28944efa69","observation_id":"7df89b55-a208-4c96-8197-b601b33a9e54","resolution":{"observed_at":"2026-05-19T06:59:03.395929Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":"2412.05237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-07-04T19:40:07.154168Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":"6b851c4c-d27c-4e39-aadd-a27efd45cfd9","year":2024},"citing_paper":{"arxiv_id":"2504.05299","last_updated":"2025-04-07T17:58:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-07T17:58:57Z","title":"SmolVLM: Redefining small and efficient multimodal models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-13T20:23:50.552549Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2504.05299"},"observation_digest":"sha256:939d30b17353b545e71f468950ad3ebb40cde9bf8432d51f86c800d678f7753e","observation_id":"8ef85ad1-efd7-4ce8-b69a-92e49a222d70","resolution":{"observed_at":"2026-05-13T20:23:51.709217Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-08-16T12:02:43.013019Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13828","last_updated":"2025-04-28T12:41:07Z","snapshot_observed_at":"2026-08-16T18:51:54.356652Z","submitted_at":"2025-04-18T17:55:58Z","title":"Generative AI Act II: Test Time Scaling Drives Cognition Engineering","version":3},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-08-16T12:02:43.013019Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2504.13828"},"observation_digest":"sha256:34736c0292574d7fb8ad07067d1d98b9fdcb92df8f1c16a8aba329e8564696ed","observation_id":"25744b38-c729-4498-af55-83cf671defc5","resolution":{"observed_at":"2026-08-16T12:02:43.013019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-08-16T11:32:28.033287Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15415","last_updated":"2025-04-21T19:53:44Z","snapshot_observed_at":"2026-08-16T11:25:01.715585Z","submitted_at":"2025-04-21T19:53:44Z","title":"IV-Bench: A Benchmark for Image-Grounded Video Perception and Reasoning in Multimodal LLMs","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-16T11:32:28.033287Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2504.15415"},"observation_digest":"sha256:cd88a1ca9813d579724d4b360009b1a27245c5e6e024d14863613e808e0a0104","observation_id":"f4cdf063-283d-4c84-8323-2a416e55d54e","resolution":{"observed_at":"2026-08-16T11:32:28.033287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-08-15T21:49:27.806428Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08971","last_updated":"2025-05-13T21:27:52Z","snapshot_observed_at":"2026-08-16T08:28:20.168838Z","submitted_at":"2025-05-13T21:27:52Z","title":"Prioritizing Image-Related Tokens Enhances Vision-Language Pre-Training","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T21:49:27.806428Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2505.08971"},"observation_digest":"sha256:0869b19dddf97bebf762acb47d50854e0e4f481b06fea4ae96a84c73890562d4","observation_id":"e98f92c9-47e8-4a08-a328-0c1cdccc6de9","resolution":{"observed_at":"2026-08-15T21:49:27.806428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":"2412.05237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-07-04T19:40:07.154168Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":"6b851c4c-d27c-4e39-aadd-a27efd45cfd9","year":2024},"citing_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-08-16T02:50:09.905402Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T16:23:41.854132Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2505.14683"},"observation_digest":"sha256:3f62f03862f627bc0124bd2237539ea8a9ea062f4d75a3a9be11b2299e00816b","observation_id":"954eea10-c87b-43cf-9ec2-6b1c8ad09be5","resolution":{"observed_at":"2026-05-10T16:23:42.186601Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":"2412.05237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-07-04T19:40:07.154168Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":"6b851c4c-d27c-4e39-aadd-a27efd45cfd9","year":2024},"citing_paper":{"arxiv_id":"2505.16416","last_updated":"2026-05-21T10:32:35Z","snapshot_observed_at":"2026-08-13T17:51:12.532194Z","submitted_at":"2025-05-22T09:05:01Z","title":"Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Large Vision-Language Models","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T14:19:34.622854Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2505.16416"},"observation_digest":"sha256:26657d7fc20acc9a39bfca7f2b3c981d947b12b4ee0d6419d402d5d49667b2cb","observation_id":"703e8ac5-584c-48aa-bd45-2f71d209e61b","resolution":{"observed_at":"2026-05-22T14:21:39.771573Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":"2412.05237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-07-04T19:40:07.154168Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":"6b851c4c-d27c-4e39-aadd-a27efd45cfd9","year":2024},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:fab68895a529b03c1230ff909417d54982cb8e8be1670542cdb5ae106ecc50ea","observation_id":"74420e64-e9bf-490e-9bad-8518905b5848","resolution":{"observed_at":"2026-05-17T03:46:06.232126Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-08-07T14:12:03.775772Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19702","last_updated":"2025-05-26T08:54:14Z","snapshot_observed_at":"2026-08-13T21:02:05.551264Z","submitted_at":"2025-05-26T08:54:14Z","title":"Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:03.775772Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2505.19702"},"observation_digest":"sha256:184c8afa826ed3f779a9dcf1b976be0dd551e994cf91e4d1c43fa65332d7b323","observation_id":"535af07f-bec3-4081-8631-57ba21dd4d66","resolution":{"observed_at":"2026-08-07T14:12:03.775772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-08-07T13:12:53.708467Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22334","last_updated":"2025-07-23T07:37:08Z","snapshot_observed_at":"2026-08-13T19:35:37.944751Z","submitted_at":"2025-05-28T13:21:38Z","title":"Advancing Multimodal Reasoning via Reinforcement Learning with Cold Start","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:53.708467Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2505.22334"},"observation_digest":"sha256:ed58a36bbfaaa75969988c294f8082582467f66de324ad01cb71913cb5dd72ba","observation_id":"f099e45b-584b-4429-90f8-7bfef4ee4b09","resolution":{"observed_at":"2026-08-07T13:12:53.708467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-08-07T12:40:44.530844Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23922","last_updated":"2025-05-29T18:15:07Z","snapshot_observed_at":"2026-08-16T10:04:41.543318Z","submitted_at":"2025-05-29T18:15:07Z","title":"ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:44.530844Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2505.23922"},"observation_digest":"sha256:0096d5aa90c94053f1f149f0d5434a8f20c96cd540c1fae1dc6910381191b60a","observation_id":"4cc616f9-4037-4362-bdce-c9897d81045c","resolution":{"observed_at":"2026-08-07T12:40:44.530844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-08-07T10:53:59.200727Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale.arXiv preprint arXiv:2412.05237, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04088","last_updated":"2025-06-04T15:46:30Z","snapshot_observed_at":"2026-08-14T20:54:08.365995Z","submitted_at":"2025-06-04T15:46:30Z","title":"Multimodal Tabular Reasoning with Privileged Structured Information","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:53:59.200727Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2506.04088"},"observation_digest":"sha256:f9b6b55c94ad7926bb692a8b7eae3fed811eff17860a755133304f40a9c89490","observation_id":"2e5b393c-95b4-44a1-8b11-cd619c3751bb","resolution":{"observed_at":"2026-08-07T10:53:59.200727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-08-07T05:45:30.600959Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-15T16:50:27.691459Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.600959Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:a374c0ad647920fc1ad1a3f3824f8f0066a52f7f03dfa271e75ac4312a26e00a","observation_id":"e5b51c26-c286-46df-9016-544557ae8b24","resolution":{"observed_at":"2026-08-07T05:45:30.600959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-08-07T05:09:18.908261Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08691","last_updated":"2025-06-10T11:02:36Z","snapshot_observed_at":"2026-08-15T05:11:45.186303Z","submitted_at":"2025-06-10T11:02:36Z","title":"VReST: Enhancing Reasoning in Large Vision-Language Models through Tree Search and Self-Reward Mechanism","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T05:09:18.908261Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2506.08691"},"observation_digest":"sha256:358bbd8e602351c350d77d5b0df370399d4484027efdd041580a08b3b45702cd","observation_id":"545bdbd5-21ae-42ef-983b-af63ca588c00","resolution":{"observed_at":"2026-08-07T05:09:18.908261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-08-07T00:34:03.216795Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T00:34:03.216795Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:4a0e589b05c482c33e038e942f7f0691e92e2fddbcce527f5d35007f8a8e2812","observation_id":"456f258d-cdda-45e3-a431-c54fb8de5b8a","resolution":{"observed_at":"2026-08-07T00:34:03.216795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-08-06T21:52:22.687226Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23115","last_updated":"2025-06-29T06:41:00Z","snapshot_observed_at":"2026-08-12T19:13:17.249586Z","submitted_at":"2025-06-29T06:41:00Z","title":"MoCa: Modality-aware Continual Pre-training Makes Better Bidirectional Multimodal Embeddings","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:22.687226Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2506.23115"},"observation_digest":"sha256:54f355f98bb05636bf557590e1f14468cb4e01a600ed7779c70fb1ae5971b988","observation_id":"de573936-c557-4175-a5a9-a506d29443bb","resolution":{"observed_at":"2026-08-06T21:52:22.687226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-08-06T21:27:39.353274Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale.arXiv preprint arXiv:2412.05237, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-16T11:52:54.914332Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:39.353274Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:759ab072b86fb792966fe060c501d5f2c340c332fffc1153c31ebb6a15b84aac","observation_id":"4a6c5b47-e72a-42bd-911d-b726c8c2e9cd","resolution":{"observed_at":"2026-08-06T21:27:39.353274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-08-06T20:15:52.742706Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-16T04:37:38.377850Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.742706Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:1669508a6f9be6045863ff1270f6575108528da34e843166247db27aa7d2a750","observation_id":"4d4fd369-42ff-48dd-aa16-8a3b2a588772","resolution":{"observed_at":"2026-08-06T20:15:52.742706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-08-06T18:43:12.605646Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07562","last_updated":"2025-07-10T09:05:49Z","snapshot_observed_at":"2026-08-15T08:46:31.528854Z","submitted_at":"2025-07-10T09:05:49Z","title":"The Synergy Dilemma of Long-CoT SFT and RL: Investigating Post-Training Techniques for Reasoning VLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:43:12.605646Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2507.07562"},"observation_digest":"sha256:99fd65314073766fd0fc50d53afdfe59457a1d1c0129d3d5a8261b6139fa3ae4","observation_id":"48f42d94-ef92-4dc4-9138-292463bcf64b","resolution":{"observed_at":"2026-08-06T18:43:12.605646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-08-05T20:15:26.877320Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10875","last_updated":"2026-06-04T15:16:30Z","snapshot_observed_at":"2026-08-16T07:41:14.131768Z","submitted_at":"2025-08-14T17:47:22Z","title":"A Survey on Diffusion Language Models","version":3},"reference_index":152,"source":"arxiv_source","source_observed_at":"2026-08-05T20:15:26.877320Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2508.10875"},"observation_digest":"sha256:7c950c8df703f784d75a4e9c9cf91f8bb64ff3ecbf104ee546c0abfeeceb0fe1","observation_id":"6fb502f8-5f62-4b9c-91fe-4b1e13d4cbbe","resolution":{"observed_at":"2026-08-05T20:15:26.877320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-08-05T10:39:02.399950Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-15T09:13:43.040229Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:02.399950Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:0d7a7b9128e41ebfe3f3ea046927c6b253ebab94c891225cc782218d0f7f2b9b","observation_id":"b685855f-c7de-430b-a29e-3eb89d776736","resolution":{"observed_at":"2026-08-05T10:39:02.399950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-08-04T15:39:35.481243Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.19244","last_updated":"2026-07-15T22:48:21Z","snapshot_observed_at":"2026-08-13T18:55:13.828466Z","submitted_at":"2025-09-23T17:05:46Z","title":"Lavida-O: Elastic Large Masked Diffusion Models for Unified Multimodal Understanding and Generation","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T15:39:35.481243Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2509.19244"},"observation_digest":"sha256:aaf4ace508a0f33fff4706f155859ea8bf98af9e7fd5fdc2747af6c6d86d08b3","observation_id":"262f9d64-69a0-4f8f-bde8-be33d8710e31","resolution":{"observed_at":"2026-08-04T15:39:35.481243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":"2412.05237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-07-04T19:40:07.154168Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":"6b851c4c-d27c-4e39-aadd-a27efd45cfd9","year":2024},"citing_paper":{"arxiv_id":"2511.22663","last_updated":"2026-05-12T09:31:31Z","snapshot_observed_at":"2026-08-12T13:36:20.792686Z","submitted_at":"2025-11-27T17:55:25Z","title":"AIA: Rethinking Architecture Decoupling Strategy In Unified Multimodal Model","version":5},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-17T04:17:07.534291Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2511.22663"},"observation_digest":"sha256:1819df19e8d49d333eb4739c5d884bbae7e5cc790040a9a92be7f898ff162937","observation_id":"0cdb59a1-27ed-4549-b01c-685666eba19b","resolution":{"observed_at":"2026-05-17T04:19:00.503308Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-08-03T16:21:32.491974Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale.arXiv preprint arXiv:2412.05237,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.14008","last_updated":"2026-07-15T22:52:21Z","snapshot_observed_at":"2026-08-13T16:10:48.024987Z","submitted_at":"2025-12-16T02:06:06Z","title":"Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T16:21:32.491974Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2512.14008"},"observation_digest":"sha256:ce3cade4442aec82500936dcf7922075d01f720891e9fb13143ea138a046f1c1","observation_id":"422dbeb9-5e7f-4fe7-90ca-88f2e6ae6291","resolution":{"observed_at":"2026-08-03T16:21:32.491974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":"2412.05237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-07-04T19:40:07.154168Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":"6b851c4c-d27c-4e39-aadd-a27efd45cfd9","year":2024},"citing_paper":{"arxiv_id":"2603.27259","last_updated":"2026-06-18T21:01:40Z","snapshot_observed_at":"2026-08-11T18:54:27.125008Z","submitted_at":"2026-03-28T12:44:19Z","title":"Seeing the Scene Matters: Revealing Forgetting in Video Understanding Models with a Scene-Aware Long-Video Benchmark","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-14T22:05:07.326202Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2603.27259"},"observation_digest":"sha256:4a5b0a06ab282076d10bb259b26476541d51afe616d3a8d80661c0173e9d0e62","observation_id":"ddbf47d8-68f0-498c-9092-dccac2e046ba","resolution":{"observed_at":"2026-05-14T22:08:04.394620Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":"2412.05237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-07-04T19:40:07.154168Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":"6b851c4c-d27c-4e39-aadd-a27efd45cfd9","year":2024},"citing_paper":{"arxiv_id":"2604.11490","last_updated":"2026-04-16T23:50:04Z","snapshot_observed_at":"2026-08-11T15:57:44.785010Z","submitted_at":"2026-04-13T13:56:00Z","title":"Anthropogenic Regional Adaptation in Multimodal Vision-Language Model","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T16:29:12.064221Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2604.11490"},"observation_digest":"sha256:7863d7a1fd01804a7def1efff2749397531e0cfc379d6dd1f7dc599b7fce06a3","observation_id":"0f5eeb8b-5a5a-402f-8a76-d3fcc9128ac7","resolution":{"observed_at":"2026-05-11T08:50:57.788020Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":"2412.05237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-07-04T19:40:07.154168Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":"6b851c4c-d27c-4e39-aadd-a27efd45cfd9","year":2024},"citing_paper":{"arxiv_id":"2604.24625","last_updated":"2026-04-27T15:52:48Z","snapshot_observed_at":"2026-08-11T14:11:36.054777Z","submitted_at":"2026-04-27T15:52:48Z","title":"Meta-CoT: Enhancing Granularity and Generalization in Image Editing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T04:30:28.636915Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2604.24625"},"observation_digest":"sha256:fd0d6d98d709807e5ca12b8e2cd63d6c17e8953e4ad44db119c059af3040b2dc","observation_id":"7cd4543e-76bc-4aef-82f1-3d065e399684","resolution":{"observed_at":"2026-05-11T21:41:19.313335Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":"2412.05237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-07-04T19:40:07.154168Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":"6b851c4c-d27c-4e39-aadd-a27efd45cfd9","year":2024},"citing_paper":{"arxiv_id":"2605.08560","last_updated":"2026-05-08T23:41:13Z","snapshot_observed_at":"2026-08-15T12:35:11.807336Z","submitted_at":"2026-05-08T23:41:13Z","title":"ZAYA1-VL-8B Technical Report","version":1},"reference_index":150,"source":"pdf_text","source_observed_at":"2026-05-12T01:15:16.607346Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2605.08560"},"observation_digest":"sha256:6fec4bed12a05216c8e6f836300be6881be02cc043ec4f03d76d1040932dac20","observation_id":"76be5cd6-6450-49f2-94c9-332626a6307e","resolution":{"observed_at":"2026-05-12T08:21:23.557358Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":"2412.05237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-07-04T19:40:07.154168Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":"6b851c4c-d27c-4e39-aadd-a27efd45cfd9","year":2024},"citing_paper":{"arxiv_id":"2605.11405","last_updated":"2026-05-13T01:55:26Z","snapshot_observed_at":"2026-08-13T09:02:50.796022Z","submitted_at":"2026-05-12T01:51:03Z","title":"20/20 Vision Language Models: A Prescription for Better VLMs through Data Curation Alone","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-13T02:52:43.674969Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2605.11405"},"observation_digest":"sha256:6d4a9e16f626bf3244618154e2d1f1c5bd13850a5f49148028557bb7d3e3dfbf","observation_id":"6e757b67-7e18-4a2b-886d-e421665c2846","resolution":{"observed_at":"2026-05-13T02:57:09.462443Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":"2412.05237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-07-04T19:40:07.154168Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":"6b851c4c-d27c-4e39-aadd-a27efd45cfd9","year":2024},"citing_paper":{"arxiv_id":"2605.11405","last_updated":"2026-05-13T01:55:26Z","snapshot_observed_at":"2026-08-13T09:02:50.796022Z","submitted_at":"2026-05-12T01:51:03Z","title":"20/20 Vision Language Models: A Prescription for Better VLMs through Data Curation Alone","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-14T21:28:37.680681Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2605.11405"},"observation_digest":"sha256:c442088700b26b53f25fad66066b515e28963d1f00dcacc7ec895b2838f80c20","observation_id":"17807cb5-4354-418f-bf11-a74de5b5aafc","resolution":{"observed_at":"2026-05-14T21:29:28.594707Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":"2412.05237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-07-04T19:40:07.154168Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":"6b851c4c-d27c-4e39-aadd-a27efd45cfd9","year":2024},"citing_paper":{"arxiv_id":"2605.17283","last_updated":"2026-05-17T06:39:05Z","snapshot_observed_at":"2026-08-14T15:06:22.101894Z","submitted_at":"2026-05-17T06:39:05Z","title":"OProver: A Unified Framework for Agentic Formal Theorem Proving","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-05-20T14:43:46.517807Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2605.17283"},"observation_digest":"sha256:9de7e64f8bb9d32885d47ad3e2a4867e136eea109b8a8de7d0a15a1480857d18","observation_id":"d4359dae-d5c6-4551-9dd7-9321babad716","resolution":{"observed_at":"2026-05-20T14:48:23.449898Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":"2412.05237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-07-04T19:40:07.154168Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":"6b851c4c-d27c-4e39-aadd-a27efd45cfd9","year":2024},"citing_paper":{"arxiv_id":"2606.00390","last_updated":"2026-05-29T22:12:40Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T22:12:40Z","title":"Zamba2-VL Technical Report","version":1},"reference_index":117,"source":"pdf_text","source_observed_at":"2026-06-28T22:34:20.970856Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2606.00390"},"observation_digest":"sha256:ac69a4e1a3ace39fa264ea1a167316b18b7c774c3f0bb3afdbdd2f20bd40967f","observation_id":"6fce37bc-1f7d-4864-8b6a-863019af4870","resolution":{"observed_at":"2026-07-01T19:26:00.687479Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":"2412.05237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-07-04T19:40:07.154168Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":"6b851c4c-d27c-4e39-aadd-a27efd45cfd9","year":2024},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-12T18:02:55.540174Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":165,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:4432a594dffbb7c978d5a8f7f09a6bd2e94b9d3fca02964e431c29e53959556f","observation_id":"f408383a-4775-42a0-928c-b751d250b4af","resolution":{"observed_at":"2026-07-03T14:38:28.896690Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":"2412.05237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-07-04T19:40:07.154168Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":"6b851c4c-d27c-4e39-aadd-a27efd45cfd9","year":2024},"citing_paper":{"arxiv_id":"2606.25432","last_updated":"2026-06-29T19:08:38Z","snapshot_observed_at":"2026-08-13T06:46:05.768847Z","submitted_at":"2026-06-24T05:50:28Z","title":"Brevity is the Soul of Inference Efficiency: Inducing Concision in VLMs via Data Curation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-06-25T21:05:36.836361Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2606.25432"},"observation_digest":"sha256:1e94d4ff72004bddb736b9996d55c0885a92ca609b568f85064427836e5f6541","observation_id":"53f7f1b4-06df-4382-85c3-14791267f844","resolution":{"observed_at":"2026-07-04T19:40:07.156125Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"cited_work":{"arxiv_id":"2412.05237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.05237","snapshot_observed_at":"2026-07-04T19:40:07.154168Z","title":"Mammoth-vl: Eliciting multimodal reasoning with instruction tuning at scale","venue":null,"work_id":"6b851c4c-d27c-4e39-aadd-a27efd45cfd9","year":2024},"citing_paper":{"arxiv_id":"2606.25432","last_updated":"2026-06-29T19:08:38Z","snapshot_observed_at":"2026-08-13T06:46:05.768847Z","submitted_at":"2026-06-24T05:50:28Z","title":"Brevity is the Soul of Inference Efficiency: Inducing Concision in VLMs via Data Curation","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-07-01T06:30:27.178950Z"},"links":{"cited_paper":"/paper/2412.05237","citing_paper":"/paper/2606.25432"},"observation_digest":"sha256:c0e9ada559142f65c1576f1d48116520708d48f5b26dca8c5ee06a61491601b0","observation_id":"a48d31d2-7767-4a25-86a5-01e2722079ac","resolution":{"observed_at":"2026-07-01T09:35:39.583796Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.05237/citation-record","integrity":"/paper/2412.05237/integrity","json":"/paper/2412.05237/citation-record.json","paper":"/paper/2412.05237"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:56:43.383428Z","title":"Consider factors like the amount of detail, depth of content, and how well the conversation and image complement each other in conveying comprehensive information","venue":null,"work_id":"61386678-c4a9-460b-843a-402374b84726","year":null},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.338938Z"},"links":{"citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:b4a1c98a4b5c107f66f3c9020b0e7ff7a699a3adce4033b1a98d4a660553e348","observation_id":"a7e3bc64-1496-4982-83c9-d097eb620ec9","resolution":{"observed_at":"2026-08-11T20:56:43.388029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:56:43.370218Z","title":"1: Very low relevance, the conversation and image are almost unrelated","venue":null,"work_id":"be1677b3-861a-40f0-9cee-45f7b873f58d","year":null},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.343675Z"},"links":{"citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:49adb6f419d34e499b4ce2d5085ead4b00a0c7ddeb5dde29c52a320b575aa9cb","observation_id":"054f2f9d-603c-4a8a-93be-addcd88cacf1","resolution":{"observed_at":"2026-08-11T20:56:43.374735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:56:43.276157Z","title":"- Instructions should require the responder to infer and utilize visual information that may not be explicitly stated in the instruction","venue":null,"work_id":"53031575-bb1c-48fe-9584-2b28be84399d","year":null},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.375026Z"},"links":{"citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:e73d15c30dceb1bcd10718fe64b9c989871e8ff6ec0ef43c2449e2a8a3959bf2","observation_id":"cc6065a3-20e9-46f8-8459-6ed942434c6f","resolution":{"observed_at":"2026-08-11T20:56:43.280677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09990","last_updated":"2024-04-15T17:59:31Z","snapshot_observed_at":"2026-08-16T14:00:43.952995Z","submitted_at":"2024-04-15T17:59:31Z","title":"HQ-Edit: A High-Quality Dataset for Instruction-based Image Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09990","snapshot_observed_at":"2026-08-11T20:56:42.304858Z","title":"In2019 International Conference on Document Analysis and Recognition (ICDAR), pages 1516–1520","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.304858Z"},"links":{"cited_paper":"/paper/2404.09990","citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:2d30d76b7a82725e27a34e87c864ea04681d6f984f70f2cb40ecce34278437a2","observation_id":"490add22-3660-420b-837b-e23c3c1befcd","resolution":{"observed_at":"2026-08-11T20:56:42.304858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:56:43.196837Z","title":null,"venue":null,"work_id":"e6a11d86-7f0f-45a9-acd4-124702066020","year":null},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.401975Z"},"links":{"citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:57e37c1398de5ce48219d517ad8b474081eb8f95c10c75ee6176fffcdf96759e","observation_id":"e3ca2bd3-d272-46fd-90f0-d7db42ebe564","resolution":{"observed_at":"2026-08-11T20:56:43.201089Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:56:43.183277Z","title":null,"venue":null,"work_id":"558f144e-2563-4d05-badd-79c13d5f5cb3","year":null},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.406176Z"},"links":{"citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:149e4761917e347560dc392caa6c598c81d66ae1dc3900ab55ea40b508539b17","observation_id":"b4673661-6c40-4a8d-9570-0215e2079d1e","resolution":{"observed_at":"2026-08-11T20:56:43.187488Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:56:43.169828Z","title":"The AI assistant’s tone should be neutral and professional","venue":null,"work_id":"4ecb28a6-1e60-4089-b1cf-906374d0f0e6","year":null},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.410370Z"},"links":{"citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:a523a36c9bc104872730b7234ec27710ab5cf4722119a6b70b98a85806cc4bed","observation_id":"980537b2-f3a8-42a7-b1fc-9a4aea3d719d","resolution":{"observed_at":"2026-08-11T20:56:43.174186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:56:43.156373Z","title":null,"venue":null,"work_id":"9e9ec1bf-2192-4050-bce9-1334d9713586","year":null},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.414758Z"},"links":{"citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:1eb4c354865da9635e39457ddc7533f89d4212dc30ed14a826206575fa5364de","observation_id":"3ef78003-fb41-4d07-9f99-2ff4665ba8e7","resolution":{"observed_at":"2026-08-11T20:56:43.161023Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:56:43.143037Z","title":null,"venue":null,"work_id":"7a0822dd-c6cb-4da2-9278-3f069cb7a4d6","year":null},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.419054Z"},"links":{"citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:25d20135574ca95063e6bb301fd2dc3cb36df53ef7658efae4064ed7e52e167f","observation_id":"aca66697-c216-4715-85eb-db3bbc45ccd8","resolution":{"observed_at":"2026-08-11T20:56:43.147364Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:56:43.357336Z","title":null,"venue":null,"work_id":"9755a0bb-c37a-4104-97a2-6fb8edd85324","year":null},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.348300Z"},"links":{"citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:ac68622713dc9044021e14a3caafb2d2c553d39b72315cb7ff3494e7d86abfa9","observation_id":"eed179a7-2c03-447d-9158-87fb19a44461","resolution":{"observed_at":"2026-08-11T20:56:43.361513Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:56:43.344466Z","title":"##Instruction##:","venue":null,"work_id":"f5d811fc-8648-40c4-9cdb-2c0e163dcbe7","year":null},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.352922Z"},"links":{"citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:08e22427e37d374a87545db6d60fb37ae7e0703bc1c87fc78cf70ee123f0b33d","observation_id":"87f8965e-ac06-4893-8272-94b9129eb785","resolution":{"observed_at":"2026-08-11T20:56:43.348657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:56:43.330859Z","title":"- Ensure the response is exhaustive, covering each stage required to reach the final answer, while considering all details from the image","venue":null,"work_id":"9f3160d5-95b8-4638-a8c7-42878bc2887d","year":null},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.357289Z"},"links":{"citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:23fbe7faaeaefa4d6eb29c196ec143631b6836d6f493b0ad6cff5b120a35aba0","observation_id":"b148c89e-0327-4551-9f70-ee52fd209962","resolution":{"observed_at":"2026-08-11T20:56:43.335367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:56:43.317167Z","title":"- Do not include additional text or explanations outside of the required <response>","venue":null,"work_id":"e8b37fdd-a1a7-4769-9251-652b1a346531","year":null},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.362132Z"},"links":{"citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:6001fec317327954f3b9689d0c952e5212f340ecb39853482b125d4fccffc0e3","observation_id":"6be6ebf7-3f10-445b-b57b-f662655085a7","resolution":{"observed_at":"2026-08-11T20:56:43.321865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:56:43.303510Z","title":"- Ensure each instruction is unique, complex, and related to the given caption and task type","venue":null,"work_id":"334df99a-ddca-4b64-8015-4bd45c773488","year":null},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.366447Z"},"links":{"citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:37685075240f1fc43da3413545e974515bdfee2536ce29db92bce72d93c0cfe6","observation_id":"64cfea06-9afa-416f-94cb-01c1057aed1f","resolution":{"observed_at":"2026-08-11T20:56:43.308063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:56:43.289527Z","title":"- Include in-depth explanations, multiple perspectives, or detailed steps where appropriate","venue":null,"work_id":"69e69a3b-df4e-4954-bd91-086752f68013","year":null},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.370692Z"},"links":{"citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:5349cfb8a6eca277e874f6513ff5d17bc0ed79707e177a24e6692b8137147f4b","observation_id":"f7af23c8-b25c-4102-bae2-fa3514812dc7","resolution":{"observed_at":"2026-08-11T20:56:43.294173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:56:43.262408Z","title":"- Your output should only consist of the generated <instruction, response>pairs","venue":null,"work_id":"a597e87d-d687-4c44-91bc-733d64839b0e","year":null},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.379111Z"},"links":{"citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:763a5273b4493d220de8d0a4617f42476834cf837b9db04212d1d6d44f46a2e0","observation_id":"ce8a3843-e2d8-4493-886b-a25fdc9c48fa","resolution":{"observed_at":"2026-08-11T20:56:43.267094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:56:43.249101Z","title":null,"venue":null,"work_id":"af6a6eec-025c-4dfa-83cf-bcde735fd7dc","year":null},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.383529Z"},"links":{"citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:1ba3e356fa54e8feadd9a56d5ae7d7d0703df6c1d7eeceff339f3aadb5d5bf13","observation_id":"df65a6b5-4dd1-422a-8665-cc84b0be16fb","resolution":{"observed_at":"2026-08-11T20:56:43.253434Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:56:43.235977Z","title":null,"venue":null,"work_id":"1e2c8a8b-4632-4064-8008-80c51b03b27b","year":null},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.388823Z"},"links":{"citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:a5acc733dcda3e8aa3642f48446c7ab1a924ec446c88961b76702801664e8bc3","observation_id":"40563e0b-3ebc-49c3-b367-f67209f86610","resolution":{"observed_at":"2026-08-11T20:56:43.240261Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:56:43.222728Z","title":null,"venue":null,"work_id":"759787ce-dcf8-4220-a97d-c15dcac73224","year":null},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.393212Z"},"links":{"citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:1edd9019d7bf8e6577f0ace5a3ab09f0884f07134504685c8f8b1fe01ee4433f","observation_id":"fc48d593-b713-45aa-9cf9-890626096fec","resolution":{"observed_at":"2026-08-11T20:56:43.226927Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:56:43.209946Z","title":null,"venue":null,"work_id":"4de47b1f-a463-4d37-8663-363a74958f4d","year":null},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.397418Z"},"links":{"citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:0a7fe073faeee01f14fc6b983e1c1ff43cd0909ece643dfbb3ef76023d01da47","observation_id":"f3d01dc4-bc1c-412b-ae5b-597e5a70fb7d","resolution":{"observed_at":"2026-08-11T20:56:43.214043Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:56:43.129352Z","title":null,"venue":null,"work_id":"82cae729-a8f6-4ab7-b058-530966306425","year":null},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.423605Z"},"links":{"citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:cb5741eaa7093fb2a868b44092f1ee0f91175893fe8cf3962ca1f7e1ad1f54ba","observation_id":"2e351fad-485c-4cb8-9b66-58744fa51813","resolution":{"observed_at":"2026-08-11T20:56:43.133911Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:56:43.115200Z","title":null,"venue":null,"work_id":"9d243fd7-e4cc-4773-b3b9-a1e04661558e","year":null},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.428168Z"},"links":{"citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:a8a43fb2f35c881d62275d3b6ce6ae2c1a007562e4765fa01727e26c72f1a147","observation_id":"913ca96c-b55e-466b-9c47-49cc2c28c219","resolution":{"observed_at":"2026-08-11T20:56:43.119616Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:56:43.101051Z","title":"Super VGA Graphics","venue":null,"work_id":"bce1ab8f-b86d-4770-86cf-465f8db32be8","year":2002},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.432381Z"},"links":{"citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:a3e8038c36c19746a56204b151091a744a4bad26dd485db8d0075f145bef8cc0","observation_id":"4d193954-d9f8-4d00-bb40-e2f84bb6f8cb","resolution":{"observed_at":"2026-08-11T20:56:43.105600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:56:43.087196Z","title":"Northgate Graphics Card","venue":null,"work_id":"fe25ddb1-0107-4375-8206-384ae1abc38f","year":null},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.437029Z"},"links":{"citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:f20478d08a62861ae73763f736388fdcbcf93cb57b70bce8c40b7ba65e9374d1","observation_id":"1f77e1e9-d855-4f88-9bb8-7582f74f9eff","resolution":{"observed_at":"2026-08-11T20:56:43.091654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:56:43.073626Z","title":"OS/2 READY!","venue":null,"work_id":"92abde92-07d2-4590-aa40-f217e84d6208","year":null},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.441483Z"},"links":{"citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:e482c00ce0761c6272193915ea4a0dc6e2e74d69c6c1033654d60575f2bfbec3","observation_id":"539d5bcb-684a-4321-8e20-43a0789c63d0","resolution":{"observed_at":"2026-08-11T20:56:43.077927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:56:43.060244Z","title":"101-key Click-Tactile Enhanced Keyboard,","venue":null,"work_id":"33f20b3c-5fe2-46a0-87fe-c0f55352db45","year":null},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.445737Z"},"links":{"citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:61b4d94f8f4379bfda5930a0df061cd1c38d4e78d7d5e6cf2c3aad0c33bf515f","observation_id":"6b5f87fc-730f-4293-bc35-8741f4262f05","resolution":{"observed_at":"2026-08-11T20:56:43.064701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:56:43.046937Z","title":null,"venue":null,"work_id":"3d277ef2-bc16-468c-8956-841f329660d8","year":2009},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.449956Z"},"links":{"citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:f6f70ee8572c1ca5899fcdfb80a0c6ac60775780165e28c858ce32bae2a2b60a","observation_id":"05522b21-9ea1-44eb-b387-2d966eb21eb9","resolution":{"observed_at":"2026-08-11T20:56:43.051481Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:56:43.033005Z","title":"This mismatch leads to an incorrect average","venue":null,"work_id":"05e78a4b-d227-469a-9f74-20c9c94abe42","year":null},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.454484Z"},"links":{"citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:38afca78dc1dbbd232c043244f43a1fed76f102f09ba892d582f5aba1ff3d5ac","observation_id":"904d6eff-a0b2-4b48-96fa-332ced07725d","resolution":{"observed_at":"2026-08-11T20:56:43.037650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:56:43.018847Z","title":"average is 60% and Germany’s average is 61.75%, but the recalculated averages (60.75% for the U.S","venue":null,"work_id":"8c7f71fd-1fd2-4f09-a796-6db03cbc0555","year":null},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.458802Z"},"links":{"citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:b6a1973a0b13e7ee1c7dfc2d55df7ee7cb8963184566c85d5d6ca4579becfca4","observation_id":"e900687f-ad93-4835-941a-9c0e0085164e","resolution":{"observed_at":"2026-08-11T20:56:43.023454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:56:43.004798Z","title":"more consistent and stable support for NATO","venue":null,"work_id":"024b3f6e-ad59-473f-8e3d-08639988927a","year":null},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.463008Z"},"links":{"citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:e8245acb0064bda9846fa01a2e871c4336346f0d9110c48143cb545c348d6f0e","observation_id":"54d70588-0b2e-4121-93f7-41eed9c3ffda","resolution":{"observed_at":"2026-08-11T20:56:43.009172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:56:42.991341Z","title":"For example, U.S","venue":null,"work_id":"0048bc7a-6325-40bc-89a6-7c9fca6fdaa4","year":null},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.467078Z"},"links":{"citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:bd1faad1b15dca78a67c0feb00de04b56e9e64b2bd85d3c7d2f015dd95222df0","observation_id":"555f2412-66db-4963-9312-45eedd7579aa","resolution":{"observed_at":"2026-08-11T20:56:42.995561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:56:42.977920Z","title":"and 61.75% for Germany) without clarifying that this is an approximation, which can lead to a misrepresentation of the actual differences","venue":null,"work_id":"bf757c52-23c7-4ba1-9bf9-4ab1987f1d4a","year":null},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.471130Z"},"links":{"citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:a5e68a37e714809415ed2fab4a7801394f849be0bab74dcaf199631be72c4de3","observation_id":"3455b15b-5e85-434e-bac7-6b50a21dac3c","resolution":{"observed_at":"2026-08-11T20:56:42.982482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:56:42.963500Z","title":"- The sum of the angles in this triangle is also 180◦","venue":null,"work_id":"422a22a6-55dd-425c-a70c-b8836d74acab","year":null},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.475269Z"},"links":{"citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:b4961e860056ee06d7d02157a4c3820ded8f3eff6abb1b3a92995199939d429a","observation_id":"901f17e3-9726-49fd-b0e8-937bbf6e10da","resolution":{"observed_at":"2026-08-11T20:56:42.968056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:56:42.949992Z","title":"- Therefore: ∠1 +∠2 = 180 ◦ - Substituting the value of∠1we found earlier: 70◦ +∠2 = 180 ◦ - Solving for∠2: ∠2 = 180◦ −70 ◦ = 110◦","venue":null,"work_id":"3f98b76b-85a6-4dba-936c-ad490aa0e412","year":null},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.479622Z"},"links":{"citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:262fac6d0d29aacc68206a1dc0cd7654be5d27f3d5ee4e70345378495a5e2bee","observation_id":"b42b6478-f991-4be7-a496-d5e8ef540d19","resolution":{"observed_at":"2026-08-11T20:56:42.954478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:56:42.936267Z","title":"Revised Answer: The answer is D","venue":null,"work_id":"6ba2a0c3-f210-4a8e-822e-ecf7b72c6a13","year":1962},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.483568Z"},"links":{"citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:230b7742bf42a2495533ad82031b1af7c82b53c3f2386da3275240dbc7319512","observation_id":"c2922e6a-7666-46d4-a238-e5e9f64f3d5c","resolution":{"observed_at":"2026-08-11T20:56:42.941111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:56:42.922913Z","title":"-Runner B runs 3 times as fast as A and also starts from the origin","venue":null,"work_id":"d4349d39-1369-42f2-a0db-06ca9009ee5e","year":null},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.488215Z"},"links":{"citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:a0117c278a841ed7e3a7450fd18f546395b632d6c568fe8938269335ab59efa5","observation_id":"81f423b2-4dc5-4184-8c7e-8229c6c45d7c","resolution":{"observed_at":"2026-08-11T20:56:42.927262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:56:42.909590Z","title":"- Since B runs 3 times as fast as A, if A runs a distancedin timet, B will run3din the same timet","venue":null,"work_id":"ebff95d3-17f0-4ab3-8f21-8ac6535e5ed5","year":null},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.492800Z"},"links":{"citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:dfb44117b6808be7191ed24354d6e5066da812519bbfaafe277efcfc1024b0b8","observation_id":"f5c44316-db32-428b-a3cb-8efed150cfed","resolution":{"observed_at":"2026-08-11T20:56:42.914158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:56:42.895073Z","title":"- The coordinates of B are(3t,0)","venue":null,"work_id":"c1dea284-9487-44f6-8aae-09e056aabb7c","year":null},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.497297Z"},"links":{"citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:f8f0b9e6fb7a3a6e71e9f62315b943331afc1cc3c90e2ce925d6696bd4ff79df","observation_id":"62d4022c-fa17-4097-876f-2faf66eff398","resolution":{"observed_at":"2026-08-11T20:56:42.900446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:56:42.881673Z","title":"- The angle formed by the line connecting the observer to A is α= tan −1 1 t","venue":null,"work_id":"e6f68cc0-6ebf-4b26-8aa9-e117987016c3","year":null},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.501617Z"},"links":{"citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:9ce67825072b45a68211db65f721dae0416fbb2e419daf2626e579bc1558db28","observation_id":"d8e8f750-2c8d-4bff-98b4-480b5edc4ab6","resolution":{"observed_at":"2026-08-11T20:56:42.886119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:56:42.868194Z","title":"- Using calculus, we can find the critical points by taking the derivative ofα−βwith respect totand setting it to zero","venue":null,"work_id":"b3c5ea5e-027d-4951-994d-78bd346dea3f","year":null},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.505884Z"},"links":{"citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:22786ce5abb632515dbf1e2a4ec87be2070102c146edb05b30f6c3087cf664ea","observation_id":"b8e30063-a3cb-484a-bbd5-807401b100d7","resolution":{"observed_at":"2026-08-11T20:56:42.872633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:56:42.855227Z","title":null,"venue":null,"work_id":"39b323e3-5f4d-448f-88dd-1068385c5b36","year":null},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.510227Z"},"links":{"citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:a4d43b3dac0c74f46bfc6e9ce2f4bd3342dac4a7bfb5f4535933e7722e75e655","observation_id":"b4cfc01e-b388-42e7-a6d4-037225beb783","resolution":{"observed_at":"2026-08-11T20:56:42.859405Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:56:42.841952Z","title":null,"venue":null,"work_id":"8f81a17e-6e60-460e-92a3-cb43c4d231af","year":null},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.514615Z"},"links":{"citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:ccfd0310f8df06da6d16181d92f49495a120b4db9e8c1dbb1af2185722589689","observation_id":"2797f5f0-7bfd-483d-8f93-4c5eedd29495","resolution":{"observed_at":"2026-08-11T20:56:42.846098Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:56:42.828432Z","title":null,"venue":null,"work_id":"2b6213f1-e1b1-4102-9c80-6f5b9d47b2ab","year":null},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.518997Z"},"links":{"citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:150419ad0dd674951c142edf2f08a023c0c50d1faf4d245416b8cc776859555a","observation_id":"530c6f4c-cc36-4f3c-a3a2-654484d1f954","resolution":{"observed_at":"2026-08-11T20:56:42.832931Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:56:42.814676Z","title":"Thus, the maximum angle of sight between the observer’s view of A and B is30 ◦","venue":null,"work_id":"75262d6c-596f-48ea-83fd-b5d41d5c3699","year":null},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.523540Z"},"links":{"citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:246369fb9f666c17af8939cc76cea9f636df91e4faa255561c911eebd642934a","observation_id":"a8beddf4-177a-4e1d-846d-074e5c626f84","resolution":{"observed_at":"2026-08-11T20:56:42.819339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:56:42.800927Z","title":"The Roman line starts at a higher population and declines over time","venue":null,"work_id":"3988ddf6-f779-462f-931e-e7f1099684a1","year":null},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.528081Z"},"links":{"citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:67fd6793a1a531e7f613ac86389a99c8173befe1b4aff6e5078dc125b076514c","observation_id":"8ddba92c-9056-4f49-8d3f-57b9aea6b5d4","resolution":{"observed_at":"2026-08-11T20:56:42.805306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:56:42.785814Z","title":"However, it does not explain why the Roman population started higher and declined more significantly than the Han population","venue":null,"work_id":"0d37e7e6-ca98-4438-8770-e98879a49eba","year":null},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.532415Z"},"links":{"citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:804a56acf2d30a12d35d0761ba616fc98e2a91d97bcacbca7d18569f1d98609b","observation_id":"dc558812-2717-4c1b-9559-6d14575b7488","resolution":{"observed_at":"2026-08-11T20:56:42.790869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:56:42.770892Z","title":null,"venue":null,"work_id":"fea99114-133b-47c9-bb35-28b9fad5fb98","year":null},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.536634Z"},"links":{"citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:b32f2e30966af911d1b9501dcb9dc5e990020a0a623bad6a75522387786e4c00","observation_id":"8767b64b-a356-446f-8d1e-104702836751","resolution":{"observed_at":"2026-08-11T20:56:42.775144Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:56:42.757218Z","title":"- The sum of these two angles is: 28◦ + 82◦ = 110◦","venue":null,"work_id":"d016a921-46cf-4ce0-8ffc-66f3b7ce7030","year":null},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.541280Z"},"links":{"citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:726460ba01098a9df4f27a55f5bac3e81ae356b04bcbe8b9b5a54a33a2c83024","observation_id":"48a2578c-abd0-4dd5-b703-9720487a0112","resolution":{"observed_at":"2026-08-11T20:56:42.761651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:56:42.742453Z","title":null,"venue":null,"work_id":"bd376386-3188-4e23-991f-0bb39138d32e","year":null},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.545488Z"},"links":{"citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:e3b249ef1741b80cef508f2127c4ece290d2017876859118b8a62bf6afc728a7","observation_id":"d7f946ae-e8bb-489d-ac2d-a034ef99c923","resolution":{"observed_at":"2026-08-11T20:56:42.746892Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:56:42.728644Z","title":"- The sum of these two angles is: 68◦ + 70◦ = 138◦","venue":null,"work_id":"c65c318e-b302-4d4a-8481-250b0087fe6e","year":null},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.549790Z"},"links":{"citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:767aa3f3add2bc3d64b49f83e6d617bd5c7f5462f29f7eed4aa09f7d062e38a5","observation_id":"0ef85754-7f1e-44bd-9912-88d3a5333eab","resolution":{"observed_at":"2026-08-11T20:56:42.733029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:56:42.711551Z","title":"Meh... Don’t worry about it. I’m a New Englander, so I’m used to it","venue":null,"work_id":"870b9d60-bae0-41c7-8de4-8cd8f675147d","year":null},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.553926Z"},"links":{"citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:955910e5b9474ad9439a036c24b971857a4792276544d061fa76ebcae3ede486","observation_id":"55a1a368-25a4-4e9a-ab79-2de937aff977","resolution":{"observed_at":"2026-08-11T20:56:42.718088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-11T20:56:42.316302Z","title":"Pan Lu, Hritik Bansal, Tony Xia, Jiacheng Liu, Chun- yuan Li, Hannaneh Hajishirzi, Hao Cheng, Kai-Wei Chang, Michel Galley, and Jianfeng Gao","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":233,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.316302Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:58ddc79bd2b95a98ed0586722914a52fdc140b8d9dad7ac77ed489d835d52d0e","observation_id":"ab998c48-f02e-47b6-8dd6-bd14219e26c9","resolution":{"observed_at":"2026-08-11T20:56:42.316302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13786","last_updated":"2023-10-30T18:35:48Z","snapshot_observed_at":"2026-08-16T15:30:45.929994Z","submitted_at":"2023-05-23T07:54:37Z","title":"Perception Test: A Diagnostic Benchmark for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13786","snapshot_observed_at":"2026-08-11T20:56:42.326943Z","title":"InBritish Machine Vision Conference, BMVC 2012, Surrey, UK, September 3-7, 2012, pages 1–11","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.326943Z"},"links":{"cited_paper":"/paper/2305.13786","citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:16e48515dd3a42962430b7b2939da63b6afd6f7c1bc5105f58fc2334a509815d","observation_id":"52d23f46-1c7e-4ab5-ada8-1cdc7367bec6","resolution":{"observed_at":"2026-08-11T20:56:42.326943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11916","last_updated":"2023-01-29T05:14:17Z","snapshot_observed_at":"2026-08-13T05:54:24.242465Z","submitted_at":"2022-05-24T09:22:26Z","title":"Large Language Models are Zero-Shot Reasoners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.11916","snapshot_observed_at":"2026-08-11T20:56:42.310449Z","title":"In2017 IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2017, Hon- olulu, HI, USA, July 21-26, 2017, pages 5376–5384","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.310449Z"},"links":{"cited_paper":"/paper/2205.11916","citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:bbf9e0efbd80bb61049b13f631a1ab233f09811d9581a6747c5e454b5d004c60","observation_id":"51ff339f-1a4a-4af2-aad2-3e22e2e8b2d5","resolution":{"observed_at":"2026-08-11T20:56:42.310449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-11T20:56:42.288573Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.288573Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:bf0891a55304c56400e78d1177bdc644aa56499aee95f786ff91c44b37ce60fb","observation_id":"4ce2f54f-6743-40d0-b54f-ed1e5658e3c8","resolution":{"observed_at":"2026-08-11T20:56:42.288573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.01718","last_updated":"2022-06-03T17:52:27Z","snapshot_observed_at":"2026-08-16T16:55:26.992897Z","submitted_at":"2022-06-03T17:52:27Z","title":"A-OKVQA: A Benchmark for Visual Question Answering using World Knowledge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.01718","snapshot_observed_at":"2026-08-11T20:56:42.333159Z","title":"Minjoon Seo, Hannaneh Hajishirzi, Ali Farhadi, Oren Etzioni, and Clint Malcolm","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.333159Z"},"links":{"cited_paper":"/paper/2206.01718","citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:d44a7e60cfa572bfc2aa7e88a7dfaa07fbe96a25df32dcf987dce0c18c14dd6a","observation_id":"01d11d0a-bccf-47c5-b7a6-7b1465b2282e","resolution":{"observed_at":"2026-08-11T20:56:42.333159Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11370","last_updated":"2025-08-20T15:45:11Z","snapshot_observed_at":"2026-08-16T14:33:42.072833Z","submitted_at":"2023-12-18T17:36:20Z","title":"G-LLaVA: Solving Geometric Problem with Multi-Modal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11370","snapshot_observed_at":"2026-08-11T20:56:42.299616Z","title":"Gemini Team","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.299616Z"},"links":{"cited_paper":"/paper/2312.11370","citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:84b2f9a67bd610e91e79eae963f819cb5b9f2eae49b53758789a280da73a0abc","observation_id":"7469164e-c094-46e2-821e-e7581b72d8a0","resolution":{"observed_at":"2026-08-11T20:56:42.299616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-11T20:56:42.294503Z","title":"InEuropean Confer- ence on Computer Vision, pages 370–387","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.294503Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:9abe4bf4d49317cb88f94935619d423c408740caf972678f219ae1900ade8a35","observation_id":"dbe0194a-c4aa-44c5-aa3a-1bf5f8819249","resolution":{"observed_at":"2026-08-11T20:56:42.294503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11069","last_updated":"2024-06-16T20:53:25Z","snapshot_observed_at":"2026-08-16T13:42:29.466840Z","submitted_at":"2024-06-16T20:53:25Z","title":"WildVision: Evaluating Vision-Language Models in the Wild with Human Preferences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11069","snapshot_observed_at":"2026-08-11T20:56:42.321445Z","title":"Pan Lu, Liang Qiu, Kai-Wei Chang, Ying Nian Wu, Song-Chun Zhu, Tanmay Rajpurohit, Peter Clark, and Ashwin Kalyan","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale","version":2},"reference_index":2521,"source":"pdf_text","source_observed_at":"2026-08-11T20:56:42.321445Z"},"links":{"cited_paper":"/paper/2406.11069","citing_paper":"/paper/2412.05237"},"observation_digest":"sha256:eef56441342c175d9de824367e0bed1a63aeb18b53068160bd65cc9feae4aa2b","observation_id":"0fa03c66-b29c-45aa-8eb7-7200d57f6a63","resolution":{"observed_at":"2026-08-11T20:56:42.321445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.05237","last_updated":"2025-06-04T10:07:57Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-15T01:01:58.686883Z","submitted_at":"2024-12-06T18:14:24Z","title":"MAmmoTH-VL: Eliciting Multimodal Reasoning with Instruction Tuning at Scale"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":33},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 41 inbound Pith citation observations for arXiv:2412.05237."}