「報酬予測」の版間の差分

38行目:

===報酬期待の神経活動===

　これまでの多くの実験から、あたかも動物の報酬への期待を反映したような神経活動が報告されている<ref name=tsutsui /> <ref name=hikosaka2006><pubmed> 16424448 </pubmed></ref> <ref name=schultz2006 />。このような神経活動は、報酬を予測する情報（パブロフ型条件づけのCS・遅延反応課題の手がかり刺激など）が呈示された後、実際に報酬を獲得するまでの間に増大し、さらに活動の増大幅は予測された報酬の量や好ましさを反映するという特徴を持つ<ref name=tsutsui /> <ref name=schultz2006><pubmed> 16318590 </pubmed></ref>。ここでは、これらの特徴も持つ神経活動を「報酬期待の神経活動」と呼ぶ。

　これまでの多くの実験から、あたかも動物の報酬への期待を反映したような神経活動が報告されている<ref name=tsutsui /> <ref name=hikosaka2006><pubmed> 16424448 </pubmed></ref> <ref name=schultz2006 />。このような神経活動は、報酬を予測する情報（パブロフ型条件づけのCS・遅延反応課題の手がかり刺激など）が呈示された後、実際に報酬を獲得する、あるいは報酬獲得のための選択行動を行うまでの間に増大し、さらに活動の増大幅は予測された報酬の量や好ましさを反映するという特徴を持つ<ref name=tsutsui /> <ref name=schultz2006><pubmed> 16318590 </pubmed></ref>。ここでは、これらの特徴も持つ神経活動を「報酬期待の神経活動」と呼ぶ。

　報酬期待の神経活動がみられる脳領野は多岐にわたっている。大脳皮質下の領域では、線条体<ref name=hassani2001 /> <ref><pubmed> 1464759 </pubmed></ref> <ref name=hikosaka2006 /> <ref><pubmed> 2723722 </pubmed></ref> <ref name=kawagoe1998 /> <ref name=samejima2005><pubmed> 12140557 </pubmed></ref> <ref><pubmed>

53行目:

　報酬予測誤差にもとづくレスコーラ＝ワグナーの学習則が、動物の報酬予測に関連した学習をよく説明することは既に述べた。このような学習の神経メカニズムとして、ドーパミンニューロンの活動が学習信号となって報酬期待の神経活動をみせる脳領域の活動を調整している可能性がある。

近年、[[ドーパミンニューロン]]の一過性の活動（phasic activity）が、強化学習の学習則で一般に報酬予測誤差と呼ばれる学習信号を符号化しているとする「ドーパミン報酬予測誤差仮説」<ref><pubmed> 9054347 </pubmed></ref>が注目されている。

近年、[[ドーパミンニューロン]]の一過性の活動（phasic activity）が、強化学習の学習則で一般に報酬予測誤差と呼ばれる学習信号を符号化しているとする「ドーパミン報酬予測誤差仮説」<ref name=schultz1997><pubmed> 9054347 </pubmed></ref>が注目されている。

　たとえば、道具的条件づけのパラダイムを用いた実験では、サルの学習に伴ってドーパミンニューロンの反応が変化することが報告されている<ref><pubmed> 7983508</pubmed></ref>。ドーパミンニューロンは、学習の初期には報酬の獲得にあわせて活動を増大させる。この反応は、学習が進むにつれ消失し、報酬を予測する手がかり刺激の呈示直後に活動が増大するようになる。また、予想された報酬が呈示されなかった場合には、報酬が予測された時刻の活動に低下がみられる<ref~~><pubmed> 10195164 </pubmed></ref~~>。これらのことは、ドーパミンニューロンが正負の報酬予測誤差を両方向的に符号化していることを示唆している<ref name=schultz2006 />。さらに、阻止効果の実験でもドーパミンニューロンが強化学習の理論から予見される学習信号を反映した活動をみせることが報告されおり<ref><pubmed> 11452299 </pubmed></ref> <ref><pubmed> 14741107 </pubmed></ref>、近年では[[オプトジェネティクス]]やマイクロスティミュレーションを用いてドーパミンニューロンの活動を人為的に操作すると学習が阻害されることが報告されている<ref><pubmed> 28390863 </pubmed></ref> 。これらのこともまたドーパミン報酬予測誤差仮説を支持している。

　たとえば、道具的条件づけのパラダイムを用いた実験では、サルの学習に伴ってドーパミンニューロンの反応が変化することが報告されている<ref><pubmed> 7983508</pubmed></ref>。ドーパミンニューロンは、学習の初期には報酬の獲得にあわせて活動を増大させる。この反応は、学習が進むにつれ消失し、報酬を予測する手がかり刺激の呈示直後に活動が増大するようになる。また、予想された報酬が呈示されなかった場合には、報酬が予測された時刻の活動に低下がみられる <ref name=schultz1997>。これらのことは、ドーパミンニューロンが正負の報酬予測誤差を両方向的に符号化していることを示唆している<ref name=schultz2006 />。さらに、阻止効果の実験でもドーパミンニューロンが強化学習の理論から予見される学習信号を反映した活動をみせることが報告されおり<ref><pubmed> 11452299 </pubmed></ref> <ref><pubmed> 14741107 </pubmed></ref>、近年では[[オプトジェネティクス]]やマイクロスティミュレーションを用いてドーパミンニューロンの活動を人為的に操作すると学習が阻害されることが報告されている<ref><pubmed> 28390863 </pubmed></ref> 。これらのこともまたドーパミン報酬予測誤差仮説を支持している。

　ドーパミンニューロンが活動するとことで起こるドーパミンの放出は、投射先の神経細胞のシナプス強度を調節する<ref><pubmed> ~~12371508~~ </pubmed></ref> <ref><pubmed> 17367873 </pubmed></ref> <ref><pubmed> 25258080</pubmed></ref>。実際、ドーパミンニューロンは、前述の報酬期待の神経活動が報告されている脳領域の多くに投射しており<ref name=hikosaka2006 /> <ref name=schultz2006 />、投射先のドーパミン濃度は報酬予測誤差を反映するよう調節される<ref><pubmed> 17603481

　ドーパミンニューロンが活動するとことで起こるドーパミンの放出は、投射先の神経細胞のシナプス強度を調節する<ref><pubmed> 11544526 </pubmed></ref> <ref><pubmed> 17367873 </pubmed></ref> <ref><pubmed> 25258080</pubmed></ref>。実際、ドーパミンニューロンは、前述の報酬期待の神経活動が報告されている脳領域の多くに投射しており<ref name=hikosaka2006 /> <ref name=schultz2006 />、投射先のドーパミン濃度は報酬予測誤差を反映するよう調節される<ref><pubmed> 17603481

</pubmed></ref>。これらのことは、報酬予測誤差を反映したドーパミンニューロンの活動が投射先のシナプス強度を調節することで、報酬予測に関連した学習が起こることを示唆している。

@@ 38行目: / 38行目: @@
 ===報酬期待の神経活動===
-　これまでの多くの実験から、あたかも動物の報酬への期待を反映したような神経活動が報告されている<ref name=tsutsui /> <ref name=hikosaka2006><pubmed> 16424448  </pubmed></ref> <ref name=schultz2006 />。このような神経活動は、報酬を予測する情報（パブロフ型条件づけのCS・遅延反応課題の手がかり刺激など）が呈示された後、実際に報酬を獲得するまでの間に増大し、さらに活動の増大幅は予測された報酬の量や好ましさを反映するという特徴を持つ<ref name=tsutsui /> <ref name=schultz2006><pubmed> 16318590 </pubmed></ref>。ここでは、これらの特徴も持つ神経活動を「報酬期待の神経活動」と呼ぶ。
+　これまでの多くの実験から、あたかも動物の報酬への期待を反映したような神経活動が報告されている<ref name=tsutsui /> <ref name=hikosaka2006><pubmed> 16424448  </pubmed></ref> <ref name=schultz2006 />。このような神経活動は、報酬を予測する情報（パブロフ型条件づけのCS・遅延反応課題の手がかり刺激など）が呈示された後、実際に報酬を獲得する、あるいは報酬獲得のための選択行動を行うまでの間に増大し、さらに活動の増大幅は予測された報酬の量や好ましさを反映するという特徴を持つ<ref name=tsutsui /> <ref name=schultz2006><pubmed> 16318590 </pubmed></ref>。ここでは、これらの特徴も持つ神経活動を「報酬期待の神経活動」と呼ぶ。
 　報酬期待の神経活動がみられる脳領野は多岐にわたっている。大脳皮質下の領域では、線条体<ref name=hassani2001 /> <ref><pubmed> 1464759 </pubmed></ref> <ref name=hikosaka2006 /> <ref><pubmed> 2723722 </pubmed></ref> <ref name=kawagoe1998 /> <ref name=samejima2005><pubmed> 12140557 </pubmed></ref> <ref><pubmed>
@@ 53行目: / 53行目: @@
 　報酬予測誤差にもとづくレスコーラ＝ワグナーの学習則が、動物の報酬予測に関連した学習をよく説明することは既に述べた。このような学習の神経メカニズムとして、ドーパミンニューロンの活動が学習信号となって報酬期待の神経活動をみせる脳領域の活動を調整している可能性がある。
-近年、[[ドーパミンニューロン]]の一過性の活動（phasic activity）が、強化学習の学習則で一般に報酬予測誤差と呼ばれる学習信号を符号化しているとする「ドーパミン報酬予測誤差仮説」<ref><pubmed> 9054347 </pubmed></ref>が注目されている。
+近年、[[ドーパミンニューロン]]の一過性の活動（phasic activity）が、強化学習の学習則で一般に報酬予測誤差と呼ばれる学習信号を符号化しているとする「ドーパミン報酬予測誤差仮説」<ref name=schultz1997><pubmed> 9054347 </pubmed></ref>が注目されている。
-　たとえば、道具的条件づけのパラダイムを用いた実験では、サルの学習に伴ってドーパミンニューロンの反応が変化することが報告されている<ref><pubmed> 7983508</pubmed></ref>。ドーパミンニューロンは、学習の初期には報酬の獲得にあわせて活動を増大させる。この反応は、学習が進むにつれ消失し、報酬を予測する手がかり刺激の呈示直後に活動が増大するようになる。また、予想された報酬が呈示されなかった場合には、報酬が予測された時刻の活動に低下がみられる<ref><pubmed> 10195164 </pubmed></ref>。これらのことは、ドーパミンニューロンが正負の報酬予測誤差を両方向的に符号化していることを示唆している<ref name=schultz2006 />。さらに、阻止効果の実験でもドーパミンニューロンが強化学習の理論から予見される学習信号を反映した活動をみせることが報告されおり<ref><pubmed> 11452299 </pubmed></ref> <ref><pubmed> 14741107 </pubmed></ref>、近年では[[オプトジェネティクス]]やマイクロスティミュレーションを用いてドーパミンニューロンの活動を人為的に操作すると学習が阻害されることが報告されている<ref><pubmed> 28390863 </pubmed></ref> 。これらのこともまたドーパミン報酬予測誤差仮説を支持している。
+　たとえば、道具的条件づけのパラダイムを用いた実験では、サルの学習に伴ってドーパミンニューロンの反応が変化することが報告されている<ref><pubmed> 7983508</pubmed></ref>。ドーパミンニューロンは、学習の初期には報酬の獲得にあわせて活動を増大させる。この反応は、学習が進むにつれ消失し、報酬を予測する手がかり刺激の呈示直後に活動が増大するようになる。また、予想された報酬が呈示されなかった場合には、報酬が予測された時刻の活動に低下がみられる <ref name=schultz1997>。これらのことは、ドーパミンニューロンが正負の報酬予測誤差を両方向的に符号化していることを示唆している<ref name=schultz2006 />。さらに、阻止効果の実験でもドーパミンニューロンが強化学習の理論から予見される学習信号を反映した活動をみせることが報告されおり<ref><pubmed> 11452299 </pubmed></ref> <ref><pubmed> 14741107 </pubmed></ref>、近年では[[オプトジェネティクス]]やマイクロスティミュレーションを用いてドーパミンニューロンの活動を人為的に操作すると学習が阻害されることが報告されている<ref><pubmed> 28390863 </pubmed></ref> 。これらのこともまたドーパミン報酬予測誤差仮説を支持している。
-　ドーパミンニューロンが活動するとことで起こるドーパミンの放出は、投射先の神経細胞のシナプス強度を調節する<ref><pubmed> 12371508 </pubmed></ref> <ref><pubmed> 17367873 </pubmed></ref> <ref><pubmed> 25258080</pubmed></ref>。実際、ドーパミンニューロンは、前述の報酬期待の神経活動が報告されている脳領域の多くに投射しており<ref name=hikosaka2006 /> <ref name=schultz2006 />、投射先のドーパミン濃度は報酬予測誤差を反映するよう調節される<ref><pubmed> 17603481
+　ドーパミンニューロンが活動するとことで起こるドーパミンの放出は、投射先の神経細胞のシナプス強度を調節する<ref><pubmed> 11544526 </pubmed></ref> <ref><pubmed> 17367873 </pubmed></ref> <ref><pubmed> 25258080</pubmed></ref>。実際、ドーパミンニューロンは、前述の報酬期待の神経活動が報告されている脳領域の多くに投射しており<ref name=hikosaka2006 /> <ref name=schultz2006 />、投射先のドーパミン濃度は報酬予測誤差を反映するよう調節される<ref><pubmed> 17603481
   </pubmed></ref>。これらのことは、報酬予測誤差を反映したドーパミンニューロンの活動が投射先のシナプス強度を調節することで、報酬予測に関連した学習が起こることを示唆している。