Pith. sign in

Paper Citation Record · LEDGER

Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning

As of 15 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 0 inbound Pith citation observations for arXiv:2607.08572.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2607.08572 v1

Coverage vector

measured 25 of 25 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-07-10T05:07:40.106099Z

measured 25 of 25 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-15T06:32:42.880941+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

25 of 25 outbound references displayed

  • verified exact20
  • verified fuzzy1
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch4

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 75206606-2d14-4ee8-9766-409d162a943f · outbound

This paper cites Qwen3-VL Technical Report.

Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning Qwen3-VL Technical Report

Reference 1

Resolution
verified exact
local_arxiv, observed 2026-07-10T05:16:48.114202Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-07-10T05:07:40.106099Z digest=sha256:c862ea5e18d0487cc8fa045d4d33c06433c230662e27146c0b08ce5461d0a777

Observation f47b38ad-c95f-4e43-9eb5-56ae2e3c5701 · outbound

This paper cites Ares: Multimodal adaptive reasoning via difficulty-aware token-level entropy shaping.

Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning Ares: Multimodal adaptive reasoning via difficulty-aware token-level entropy shaping

Reference 2

Resolution
verified exact
arxiv_id, observed 2026-07-10T05:16:48.117346Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-07-10T05:07:40.106099Z digest=sha256:bc110193457829da3a9f1b29b7f9989e65150db52a5461d1d8d87fa557944c06

Observation cb889607-63a3-4f79-8594-f425090b6a7c · outbound

This paper cites Video-R1: Reinforcing Video Reasoning in MLLMs.

Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning Video-R1: Reinforcing Video Reasoning in MLLMs

Reference 3

Resolution
metadata mismatch
local_arxiv, observed 2026-07-10T05:16:48.127937Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-07-10T05:07:40.106099Z digest=sha256:5541e125aa0ca39b6d97b1d8dd16c52bef1c8846456ebb91f425bdcc0a3df700

Observation 73c4187c-fa4e-477a-9202-0e1a3dd727f4 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 4

Resolution
verified exact
local_arxiv, observed 2026-07-10T05:16:48.103262Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-07-10T05:07:40.106099Z digest=sha256:e1e4d06cb36495f921fb7b96387b7c56f83531300676a0fd30964b57641b1522

Observation 0596a9b0-fd0d-41ec-9eaa-bc89c8382b7e · outbound

This paper cites ThinkPrune: Pruning Long Chain-of-Thought of LLMs via Reinforcement Learning.

Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning ThinkPrune: Pruning Long Chain-of-Thought of LLMs via Reinforcement Learning

Reference 5

Resolution
verified exact
local_arxiv, observed 2026-07-10T05:16:48.069730Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-07-10T05:07:40.106099Z digest=sha256:8bcc3e3b68ad04e12f4fd569ac40224e0feac634301377a4a625163da0a2d1df

Observation acad75f2-78db-4485-91aa-9a6d2cca548a · outbound

This paper cites Boosting MLLM Reasoning with Text-Debiased Hint-GRPO.

Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning Boosting MLLM Reasoning with Text-Debiased Hint-GRPO

Reference 6

Resolution
metadata mismatch
local_arxiv, observed 2026-07-10T05:16:48.100099Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-07-10T05:07:40.106099Z digest=sha256:8d2c7e7fbc1ede093c040e7ab675139a757563e37ffaf605eb4c1ed0736ee0b2

Observation 6182bec2-599a-4f4a-aaa2-ab55463b8b88 · outbound

This paper cites LLaVA-OneVision: Easy Visual Task Transfer.

Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning LLaVA-OneVision: Easy Visual Task Transfer

Reference 7

Resolution
verified exact
local_arxiv, observed 2026-07-10T05:16:48.133413Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-07-10T05:07:40.106099Z digest=sha256:af51c1b79e520ea5c9b5679fb04898c7353a8f2def5b3b146e3c39e43992e722

Observation 3a2061e6-be90-4961-b661-0e466d79821e · outbound

This paper cites Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle.

Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle

Reference 8

Resolution
verified exact
local_arxiv, observed 2026-07-10T05:16:48.097060Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-07-10T05:07:40.106099Z digest=sha256:6400f564c508e84137b0a7f6250d2971e2b888bcae6c2ae468009b6095e24674

Observation 445bfd8a-f823-46ed-a448-fdd75fb93c32 · outbound

This paper cites Visual-RFT: Visual Reinforcement Fine-Tuning.

Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning Visual-RFT: Visual Reinforcement Fine-Tuning

Reference 9

Resolution
verified exact
local_arxiv, observed 2026-07-10T05:16:48.105897Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-07-10T05:07:40.106099Z digest=sha256:9ad024d1f7122beab08ead8aeb9fde4adb5acb6fe2ff037f789e44910f5e349c

Observation 60df4eee-bb17-4688-a3ee-162763452667 · outbound

This paper cites IconQA: A New Benchmark for Abstract Diagram Understanding and Visual Language Reasoning.

Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning IconQA: A New Benchmark for Abstract Diagram Understanding and Visual Language Reasoning

Reference 10

Resolution
verified exact
local_arxiv, observed 2026-07-10T05:16:48.108859Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-07-10T05:07:40.106099Z digest=sha256:69a1a418d0562c6ca52467e66b17adab1774cc85e5ce6aea7d9bb332d429c4f9

Observation 23937e72-3d26-4014-8c13-480738d92280 · outbound

This paper cites TERMINATOR: Learning Optimal Exit Points for Early Stopping in Chain-of-Thought Reasoning.

Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning TERMINATOR: Learning Optimal Exit Points for Early Stopping in Chain-of-Thought Reasoning

Reference 11

Resolution
verified exact
local_arxiv, observed 2026-07-10T05:16:48.111617Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-07-10T05:07:40.106099Z digest=sha256:8c8fff96f5e70c38c329576067d4ef4ac89a1f2619bd0759564cb0854171ee65

Observation 32d2dd63-4520-40eb-93b5-0f6064373c65 · outbound

This paper cites Safegrpo: Self-rewarded multimodal safety alignment via rule-governed policy optimization.arXiv preprint arXiv:2511.12982,.

Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning Safegrpo: Self-rewarded multimodal safety alignment via rule-governed policy optimization.arXiv preprint arXiv:2511.12982,

Reference 12

Resolution
verified exact
arxiv_id, observed 2026-07-10T05:16:48.120378Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-07-10T05:07:40.106099Z digest=sha256:b7ffa619d5e11f358f7f00b52945c19c54c44ae33ce9a39d448d7159bfbe68a4

Observation 6f8f9413-c154-4aec-8677-78b768dce8ad · outbound

This paper cites Proximal Policy Optimization Algorithms.

Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning Proximal Policy Optimization Algorithms

Reference 13

Resolution
verified exact
local_arxiv, observed 2026-07-10T05:16:48.125440Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-07-10T05:07:40.106099Z digest=sha256:99769d4c3562228ba255c7df339fd78e1e81cb62d0ac9a6152f77ab2bd89f754

Observation 85f4df1b-6102-4138-b5ce-8e10c571ab83 · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 14

Resolution
verified exact
local_arxiv, observed 2026-07-10T05:16:48.136244Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-07-10T05:07:40.106099Z digest=sha256:67353ecb30b47401beee1c7637c6996e520f2b841db5109b867b9fdd5a7cf465

Observation caec8aa2-2cc6-4a14-8bfc-28456e20a3fa · outbound

This paper cites Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution.

Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution

Reference 15

Resolution
metadata mismatch
local_arxiv, observed 2026-07-10T05:16:48.130529Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-07-10T05:07:40.106099Z digest=sha256:9974f278f4554fee49c17b1808c5b84c899677fcc38bd54b8a19f278e2941470

Observation cbdb5770-6e00-4341-98d8-226e05c37194 · outbound

This paper cites AdaptR1: Reinforcement Learning Based Adaptive Interleaved Thinking in Multi-hop Question Answering.

Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning AdaptR1: Reinforcement Learning Based Adaptive Interleaved Thinking in Multi-hop Question Answering

Reference 16

Resolution
verified exact
local_arxiv, observed 2026-07-10T05:16:48.091457Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-07-10T05:07:40.106099Z digest=sha256:7eb8345585ad2e4e30fd6cffb98c90dfbbfed2c2eb57d7bd0aef3e1b5044dded

Observation 5e486c2b-ec80-4531-a2e7-5dde2d114f28 · outbound

This paper cites When More is Less: Understanding Chain-of-Thought Length in LLMs.

Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning When More is Less: Understanding Chain-of-Thought Length in LLMs

Reference 17

Resolution
verified exact
local_arxiv, observed 2026-07-10T05:16:48.094170Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-07-10T05:07:40.106099Z digest=sha256:46a9ab99f793d36c5b56cc5cf76d440013895d3e749384c92149fa3cd17d3ea5

Observation ede9c4e3-60de-4973-8663-4d65770c8b26 · outbound

This paper cites Dynamic early exit in reasoning models.arXiv preprint arXiv:2504.15895, 2025a.

Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning Dynamic early exit in reasoning models.arXiv preprint arXiv:2504.15895, 2025a

Reference 18

Resolution
verified exact
arxiv_id, observed 2026-07-10T05:16:48.085721Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-07-10T05:07:40.106099Z digest=sha256:e06d1535eaf5327c5537c86c86885053f78c44423f0e6fbffa36dd0318cf2a80

Observation 172c5265-982d-45bd-88fc-ec64add2b199 · outbound

This paper cites R-4B: Incentivizing General-Purpose Auto-Thinking Capability in MLLMs via Bi-Mode Annealing and Reinforce Learning.

Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning R-4B: Incentivizing General-Purpose Auto-Thinking Capability in MLLMs via Bi-Mode Annealing and Reinforce Learning

Reference 19

Resolution
verified exact
local_arxiv, observed 2026-07-10T05:16:48.088969Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-07-10T05:07:40.106099Z digest=sha256:530aa3d2a84a96a0c08c652c254ae7f255b2563f09d7eb757aa066fcb702843b

Observation 86302e5a-d931-4bed-a8b0-c36aaa99e3f9 · outbound

This paper cites R1-ShareVL: Incentivizing Reasoning Capability of Multimodal Large Language Models via Share-GRPO.

Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning R1-ShareVL: Incentivizing Reasoning Capability of Multimodal Large Language Models via Share-GRPO

Reference 20

Resolution
verified exact
local_arxiv, observed 2026-07-10T05:16:48.067239Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-07-10T05:07:40.106099Z digest=sha256:853455adcf19b1bc0b8139b3338e692f8c7ba551270d88b5eb6e49c4b0680c8f

Observation 03dc2a73-379d-46d3-b1bd-3180698589b6 · outbound

This paper cites A Survey of Safety on Large Vision-Language Models: Attacks, Defenses and Evaluations.

Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning A Survey of Safety on Large Vision-Language Models: Attacks, Defenses and Evaluations

Reference 21

Resolution
verified exact
local_arxiv, observed 2026-07-10T05:16:48.123078Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-07-10T05:07:40.106099Z digest=sha256:6f389a661563d3200d17c27b4a0abe37b45252809f00746fcf8bdf701b3bede5

Observation 1a8593ca-a459-4bfa-bb0a-a2a8f5dcbca8 · outbound

This paper cites R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization.

Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization

Reference 22

Resolution
metadata mismatch
local_arxiv, observed 2026-07-10T05:16:48.081912Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-07-10T05:07:40.106099Z digest=sha256:bdcea764bbbac5e0f76b778472fd71de5da7237c33e3608f769d3e5300997bb4

Observation e61c7e6f-ad04-4b8a-a5a2-404dba7ec733 · outbound

This paper cites Reinforced MLLM: A Survey on RL-Based Reasoning in Multimodal Large Language Models.

Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning Reinforced MLLM: A Survey on RL-Based Reasoning in Multimodal Large Language Models

Reference 23

Resolution
verified exact
local_arxiv, observed 2026-07-10T05:16:48.079134Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-07-10T05:07:40.106099Z digest=sha256:7fec6cefbdf5c7627a0e82aad3423dabaa2577217b76892c4f69147e7003b784

Observation dc21e25c-2802-4e4a-977c-f18ea9d45bc3 · outbound

This paper cites Think in Blocks: Adaptive Reasoning from Direct Response to Deep Reasoning.

Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning Think in Blocks: Adaptive Reasoning from Direct Response to Deep Reasoning

Reference 24

Resolution
verified exact
local_arxiv, observed 2026-07-10T05:16:48.076132Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-07-10T05:07:40.106099Z digest=sha256:0b181c70e1436477425f01fe6e60668dc7872c64a3dd42e7de7829149c76893c

Observation e9edec57-32d4-4589-99aa-0d0537938e3c · outbound

This paper cites Mathe- matics includes Geometry3k and MathVista; Chart/Doc comprises ChartQA and DocVQA; Ground- ing consists of RefAdv; and the remaining benchmarks are grouped under General.

Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning Mathe- matics includes Geometry3k and MathVista; Chart/Doc comprises ChartQA and DocVQA; Ground- ing consists of RefAdv; and the remaining benchmarks are grouped under General

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-07-10T05:16:48.395291Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-07-10T05:07:40.106099Z digest=sha256:ba869f6f224eb91f4c28ea83e872b412dda60401a702785205719ac3db9308cd

Pith citing papers

No inbound Pith citation observations are available.